Gemma 4 E2B:Google 的口袋端侧 LLM

面向移动设备的多模态模型与 Apache 2.0 许可证;真实下载体积和内存占用取决于具体 LiteRT-LM 部署包。

最后校验: 2026 年 5 月
参数量2.3 B
量化后大小1.5 GB
上下文长度128,000 tokens
模态text+vision+audio
许可证apache-2.0
最低 RAM4 GB
版本Gemma 4 E2B-it
发布2026-04

它是什么?

Gemma 4 E2B 是 Google DeepMind 在 Gemma 4 家族里面向移动部署的成员,2026 年 4 月发布。Cove 当前在 Android 应用家族中集成了固定版本的 Gemma 4 LiteRT-LM 包;应用仍处在测试与商店发布阶段,所以本页会把“代码已接入”和“已有公开用户验证”严格分开。

关于参数量的小注:官方标注为「E2B = 2.3B 有效参数」,指每次前向计算时实际激活的权重。参数口径不等于最终下载包体积;量化、容器元数据和运行时打包都会改变交付文件,Cove 当前固定的 E2B LiteRT-LM 包约为 2.58GB。

核心规格一览

(请参考上方规格卡,数据来自结构化数据层。)

什么设备能跑?

Gemma 4 E2B 面向当前移动与桌面硬件,但模型卡不能保证某一款手机上的生产表现。量化、上下文长度、模态、加速器支持和温控都会影响结果。真正发布前,应在最低 RAM 与最低芯片档位上验证实际部署包。

优势与局限

优势。 通用文本任务下尺寸/质量比堪称最佳,原生支持文本+视觉+音频多模态,Apache 2.0 友好许可,Google 官方维护活跃且每季度迭代。从更大的 Gemini 家族蒸馏而来,赋予它远超参数量本身的知识广度。

局限。 数学与推理 benchmark 略逊于 Phi-4-multimodal。128K 上下文已与 Llama 3.2 持平,不再是长文档瓶颈 —— 但多语种质量参差,前 20 大语言强势,长尾语种支持欠佳。

适合什么场景?不适合什么场景?

选 Gemma 4 E2B 当: 你需要一个均衡的通用端侧模型;你想在同一 runtime 里同时处理文本+视觉+音频;你的目标设备 RAM 4GB 起步;你重视许可证简洁性。

别选它当: 你的工作负载推理密集(用 Phi-4-multimodal 或 DeepSeek-R1 Distill);你需要百万 token 级上下文(目前仍是云端独占);你只面向 Apple 生态且偏好原生工具(用 Apple Foundation Models)。

与相似端侧模型对比

最相近的两位兄弟:Microsoft Phi-4-multimodal(参数更多、推理更锐利、MIT 许可证、同样支持文本+视觉+音频)与 Qwen 3.5 2B(中文更强、规模相当、262K 上下文)。完整横评见 leaderboard

在 Cove App 里的真实落地

Cove Travel 已接入 Gemma 4 的离线翻译流程,Cove Voice 复用同一端侧推理层完成笔记整理。它们是已经实现的 Android 产品路径,但仍在推进封测与商店发布;真实设备 benchmark 和发布证据会随测试补充。

中文工程实践可继续阅读奇连 AI 的 Gemma 4 本地部署教程

在 Cove App 里看真实落地

常见问题

Gemma 4 E2B 能在 iPhone 上跑吗?

可以。Gemma 4 E2B 在 iPhone 15 Pro 或以上机型流畅运行,借助 Apple Neural Engine 和 8GB 统一内存。iPhone 14 及更早机型 RAM 不足,难以承载 4-bit 量化的 2.3B 参数推理。

Gemma 4 E2B 实际下载大小是多少?

没有唯一数字:量化和打包方式都会改变体积。参考 4-bit 权重可能约 1.5GB,而 Cove 当前固定使用的 LiteRT-LM 部署包为 2,583,085,056 字节。存储预检必须以真正交付的文件为准。

Gemma 4 E2B 是开源的吗?

是。Gemma 4 这一代起从早期 Gemma 自定义许可证迁移到了 Apache 2.0,权重完全开放,允许商业使用与再分发,仅需遵守 Apache 标准的署名要求。

Gemma 4 E2B 在手机上的推理速度如何?

速度取决于部署包、输入长度、硬件加速路径、内存带宽、温控和系统版本。厂商 benchmark 只能作为参考,发布前必须用真正交付的模型文件逐档验证目标设备,并记录持续运行与 CPU 回退时的差异。

Gemma 4 E2B 和 Phi-4-multimodal 怎么选?

Gemma 4 E2B 更小(2.3B 有效参数 vs 5.6B),同硬件下更快;Phi-4-multimodal 推理能力更强。两者都原生支持文本+视觉+音频,选择主要看你的 RAM 预算。详见我们的 Phi-4 详情对比。

引用源