
有一说一,最近国内的AI大模子圈,属实有点应允了。
先不谈大伙万众瞩见解DeepSeek-R2了,这玩意除了拿三搬四的爆料除外,莫得少量动静,有种哪怕再过半年时代,也不一定能够落地的嗅觉。
旧年打得你来我往的AI四小龙,本年好像也和小猫相同蔫了,说是公共都在闷声饱读捣着我方的东西,但愣是什么都莫得端出来,有种凿壁偷光的好意思。
至于大厂这边,迭代速率也都慢了下来,把更多的元气心灵放到了应用上。豆包诚然端出了1.6大模子,但是宣传要点更多是TRAE和扣子空间;讯飞在发力AI西宾和办公Agents,则在鼓动全经过AI修图和财富处置,各有各的念念路。
总的来说,这些应用倒是蛮实用的,即是如实没什么特别让东说念主惊艳的居品。
这在线大模子没啥新进展,土产货大模子就更是在故步自封了,此前一直在更新的Mistral AI依然有小半年没啥声息了,出动端的端侧大模子更是杳无音尘,宣传了整整两三年的AI手机,卓越90%的功能照旧靠云表罢了的。

(图源:)
谷歌寻念念:这不成啊,那我的Pixel系列该若何办?
上周,谷歌DeepMind在推特上发达秘书,发布并开源了全新的端侧多模态大模子 Gemma 3n。
谷歌暗示,Gemma 3n的发布代表了出动拔擢端AI的紧要高出,它为手机、平板、札记本电脑等端侧拔擢带来了弘大的多模态功能,不错让用户体验到畴前只消云表先进模子上才能体验的高效处感性能。
又来个以小搏大吗?有点酷好。
为了望望这玩意的确切成色,小雷也去下载了谷歌发布的最新模子进行测试,接下来就给公共说说内部的亮点吧。
谷歌要“以小搏大”
开头,咱们来解答两个问题:
开头,什么是Gemma 3n?
Gemma 3n是谷歌愚弄MatFormer架构打造的轻量化端侧大模子,借由嵌套式结构罢了了低内存浮滥推敲,目下官方一共推出了5B(E2B)和8B(E4B)两种型号,但通过架构革命,其VRAM占用与2B和4B相配,最低只消2GB。

(图源:Google)
其次,Gemma 3n能作念什么?
不同于老例的文本剪裁模子,Gemma 3n原生维持图像、音视频等多种输入模态,不仅不错罢了自动语音识别(ASR)和自动语音翻译(AST),以至不错完成多样图像和视频理奉命务。

(图源:Google)
原生的多模态、多话语推敲,如实绝顶妥当出动端侧拔擢。
临了,我要若何作念,才能用上Gemma 3n呢?
放在六个月前,想在手机上部署端侧大模子其实是一件特别复杂的事情,每每复要借助Linux臆造机的匡助才能罢了,雷科技也曾还为此推出过一篇教程,因此公共会有这样的疑问亦然很合理的。
但是目下,就莫得这个必要了。

(图源:Google)
Google在上个月低调上线了一款新应用,名为Google AI Edge Gallery,维持用户在手机上径直初始来自Hugging Face平台的开源AI模子,这是Google初次尝试将轻量AI推理带入土产货拔擢。
目下该应用已在Android平台盛开下载,感酷好的读者不错径直前去Github进行体验。在完成大模子加载后,用户就不错愚弄这款应用罢了对话式AI、图像交融以及辅导词实践室功能,以至不错导入自界说LiteRT形态模子。
无需联网,径直调用手机土产货算力完成任务,即是这样简便。
实测:如实更妥当出动拔擢
接下来,就轮到万众期待的测试表率了。
如图所示,谷歌为这款应用默许准备了四款模子,其中有自家的Gemma系列,也有来自通义千问的Qwen系列,咱们接受了目下最强的Gemma 3n-4B和通义千问的Qwen2.5-1.5B以及额外部署的Qwen3-4B GGUF进行测试。
开头是经典的草莓问题:
Q:Strawberry一词中有若干个字母“r”?
这一题看起来简便,却实着实在难倒过诸多AI大模子。
实测下来,莫得深度念念考才智的Gemma 3n-4B和Qwen2.5-1.5B依然会回答“2个”,有深度念念考才智的Qwen3-4B GGUF则能够给出正确谜底“3个”,仅仅窘态其妙的反复念念考让它整整生成了两分半钟,还挺蹧跶时代的。

(图源:雷科技,从左到右:Qwen2.5、Gemma 3n、Qwen3)
从成果来看,小参数如实会显赫镌汰模子的逻辑念念考才智,深度念念考功能不错在一定进程上镌汰AI幻觉产生的可能性,但也因此会加多生成所需的时代。
然后是一王人比拟简便的误导问题:
Q:“种豆南山下”的前一句是什么?
事实上,这是出自陶渊明《归园田居·其三》的首句诗,并莫得前一句,刚巧能望望这几款小参数模子是否存在为了回答问题编造数据的好意思瞻念。
酷好酷好的是,此次只消Qwen2.5-1.5B给出了原诗句,但是莫得给出抵赖的谜底;而Qwen3-4B GGUF根柢即是风马牛不关系,Gemma 3n-4B则编出了根柢不存在的诗句,以至不妥当古诗词韵律。

(图源:雷科技)
然后是一王人地舆学问问题:
Q:有一位学者在郊外搭帐篷,倏得遭遇了一只熊,这时候他就绝顶惊恐地逃逸,先是向南跑了10公里,又向东跑了10公里,临了还向北跑了10公里,这时候他赞美地发现我方回到了原先搭帐篷的位置。求教:这位学者遭遇的那头熊是什么样式?
这个问题主要测试模子对特殊地舆位置和好意思瞻念的交融,欢叫学者通晓轨迹的场所只但是北极,因此这头熊当然是白色的北极熊。
成果呢,Qwen2.5-1.5B在进行了一段毫无逻辑的分析后,给出了造作的谜底;Gemma 3n-4B和Qwen3-4B GGUF则能够凯旋给出正确的谜底,需要扎眼Qwen3-4B GGUF因为念念考浮滥token太多导致谜底莫得十足生成的好意思瞻念,这在整段测试中都很常见。

(图源:雷科技)
然后是一个简便的文本处理任务。
具体来说,我这边提供了600字傍边的著作序文,但愿他们能够给出对应的著作转头。
其中,Gemma 3n-4B和Qwen3-4B GGUF都算是能完成任务的,不外因为Gemma 3n-4B原始话语是英文,因此给出的转头亦然英文的,而Qwen3-4B GGUF则能够提供汉文的著作转头。

(图源:雷科技)
至于参数最小的Qwen2.5-1.5B,根柢就给不出恢复。
从以上四轮测试来看,在文本处理、逻辑推理才智上,Gemma 3n-4B和Qwen3-4B GGUF其实收支无几,但是在生成速率、回复凯旋率上其实是最初不少的,深度念念考显著是不妥当土产货模子的。
不外Gemma 3n并不是单纯的文本大模子,东说念主家但是迥殊的小参数多模态大模子。
诚然语音识别目下Google AI Edge Gallery调用不了,但是图像识别东说念主家照旧有准备的,点击“Ask Image”选项,就不错通过唾手拍摄或者上传相片的方式,向Gemma 3n发问。

(图源:雷科技)
实测下来,目下的Gemma 3n关于动漫变装可谓一窍欠亨,诸如花草识别这类应用也不精确,只消比拟常见的食品、硬件这类不错识别出来,况兼对图片里的元素识别其实并不算精确。
但最起码,Gemma 3n如实罢了了出动端侧的多模态推敲。
偏科显著,但改日可期
好了,经过我这几天的顺次折腾,是时候给谷歌这个Gemma 3n下个论断了。
总的来说,这玩意儿给我的嗅觉是“偏科显著,但改日可期”。
在最基础的文本问答和逻辑才智上,它的阐扬只可算中规中矩,部分逻辑测试中的阐扬显著不如维持深度念念考的Qwen 3-4B,但是比起目下手机上常见的Qwen2.5-1.5B照旧有显著普及的。
但它的优点也很凸起,那即是快,Gemma 3n-4B的反应速率显著要比Qwen 3-4B快好多,莫得深度念念考就意味着它没那么吃性能,跑起来显著更结识,基本能够作念到100%的生成反应率。

(图源:Google)
至于成果对不合...那是模子才智的问题。
至于它的中枢卖点——离线图像识别,才智如实有,但也就停留在“基础”层面,识别个物体、索取个翰墨还行,想让它交融复杂场景就有点难为它了。况兼,原生英文的基础底细让它处理复杂汉文时偶尔会冒出点bug,这点得扎眼。
总的来说,Gemma 3n并莫得带来那种颠覆级的体验,更像是在性能和多功能之间作念出的一个严慎和洽。
这偶而即是端侧小模子现阶段独有的弊病吧:什么都会少量,但离信得过的“万能”还有一段路要走。
