返回模型目录
文本生成代码视觉理解语音识别

Gemma 4 E2B IT

面向本地设备的指令微调多模态模型,接受文本、图像和音频输入。

最后核实:

https://huggingface.co/google/gemma-4-E2B-it

特点与限制

主要特点

  • PLE逐层嵌入
  • 原生128K上下文
  • 支持system角色与可配置思考模式
  • 音频转写与图像理解

使用边界

  • E2B命名代表有效参数口径,实际权重不等同于2B稠密模型。
  • 模型输出为文本,音频输入能力不代表音频生成。
  • 不同语言与任务效果需要目标场景验证。

模型信息

家族与版本
Gemma / 4
输入与输出
文本、图像、音频 → 文本
公开参数规模
5.1B(以以下来源口径为准)
激活 / 有效参数
未提供 / 2.3B
参数口径
官方E2B表格:2.3B effective,含嵌入表为5.1B;PLE嵌入采用查表方式,有效参数不等于MoE激活参数。视觉编码器另列约150M、音频编码器约300M,5.1B不被当作全部多模态组件的合计。 参数来源
原生上下文
131,072 tokens
扩展上下文
未提供
语言声明
多语言(预训练覆盖140余种;官方称开箱支持35余种);语言支持不代表对应语言的评测水平。
权重许可
Apache-2.0
代码许可
未核实
训练资料
官方提供模型卡或技术报告;未公开完整训练数据清单。

能力依据

模型变体:指令版;家族与版本:Gemma / 4

文本生成 仅官方依据

MMLU Pro60%官方报告 · en
查看评估与来源收起补充信息

可作为英语知识问答候选:官方 MMLU Pro 成绩为 60.0%。该指标不能说明中文长文写作或事实回答可靠性。

已有依据支持
  • 已登记一项英语知识与推理基准的官方成绩。
证据限制
  • MMLU Pro 单项考试成绩不能替代目标场景验证。
  • 本站未运行模型验证实际对话表现。

MMLU Pro · 60%官方报告 · Google DeepMind

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
google/gemma-4-E2B-it / 未提供
思考模式
未知
量化 / 运行时
未提供 / 未提供
数据集 / 划分
MMLU Pro / 未提供
基准 / 报告版本
官方模型卡未注明数据版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Google 官方卡的 instruction-tuned 表列 Gemma 4 E2B 为 60.0%。未披露该行的 few-shot、提示模板、输出长度和推理模式;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/google/gemma-4-E2B-it
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
比较状态
不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。

代码 仅官方依据

LiveCodeBench v644%官方报告 · code
查看评估与来源收起补充信息

可作为需执行测试核验的代码生成候选:官方 LiveCodeBench v6 成绩为 44.0%。单一基准不能保证复杂项目修改正确。

已有依据支持
  • 官方报告包含该型号的代码生成基准成绩。
证据限制
  • 复杂项目修改仍需在目标仓库运行测试验证。
  • 提示、采样和生成长度等条件未完整披露。

LiveCodeBench v6 · 44%官方报告 · Google DeepMind

score · 越高越好 · code · 摘要引用

展开评测条件与来源
模型标识 / 修订
google/gemma-4-E2B-it / 未提供
思考模式
未知
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench / 未提供
基准 / 报告版本
v6
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Google 官方卡的 instruction-tuned 表列 Gemma 4 E2B 为 44.0%。未披露该行的 few-shot、提示模板、输出长度和推理模式;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/google/gemma-4-E2B-it
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
比较状态
不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。

视觉理解 仅官方依据

MMMU Pro44.2%官方报告 · en
查看评估与来源收起补充信息

可作为图文问答候选:官方 MMMU Pro 成绩为 44.2%。该单项视觉推理结果不能保证 OCR 准确或细节图像识别效果。

已有依据支持
  • 官方报告提供多模态视觉推理基准数据。
证据限制
  • OCR 与细节识别需要按目标图像另行验证。
  • 本站未使用本地图片输入验证识图效果。

MMMU Pro · 44.2%官方报告 · Google DeepMind

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
google/gemma-4-E2B-it / 未提供
思考模式
未知
量化 / 运行时
未提供 / 未提供
数据集 / 划分
MMMU Pro / 未提供
基准 / 报告版本
官方模型卡未注明数据版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Google 官方卡视觉表列 Gemma 4 E2B 为 44.2%。未披露该行的few-shot、提示模板、输出长度和推理模式;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/google/gemma-4-E2B-it
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
比较状态
不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。

语音识别 仅官方依据

FLEURS ASR0.08比率官方报告 · en
查看评估与来源收起补充信息

可作为英语语音转写候选:官方 FLEURS 英语行的 WER 为 0.080(越低越好)。该数据只说明报告所列英语测试结果。

已有依据支持
  • 官方报告提供一项明确区分 WER 与 CER 的语音识别结果。
证据限制
  • 该结果不能代表其他语言或本站音频的实际识别效果。
  • 音频与解码配置不足以复现统一条件比较。

FLEURS ASR · 0.08(比率)官方报告 · Google DeepMind

word error rate · 越低越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
google/gemma-4-E2B-it / 未提供
思考模式
不适用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
FLEURS / 未提供
基准 / 报告版本
官方技术报告 Table 7
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Google 官方技术报告将英文列为 WER,Gemma 4 E2B 数值为 0.080。其他测试语言中带星号的列使用 CER;此记录只取英文 WER。报告未给出该行的模型revision、few-shot、提示模板或生成长度;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2607.02770
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖报告原文或第三方内容许可。 查看说明
比较状态
不可比:报告给出了数据集、英文列和WER指标,但未披露模型revision及足以统一复测的音频、解码和提示配置。

运行条件与获取

Transformers

系统支持未提供 · Safetensors · 未指定量化

官方支持;本站尚未进行推理验证。

硬件:未核实。本站未实测;内存、显存和速度取决于运行时、精度、输入长度与硬件,不将参数量或文件大小换算为资源保证。

内存:未核实;显存:未核实。

依赖:transformers(官方要求最新版)、torch、accelerate、torchvision(图像输入)、librosa(音频输入)。

STEP 01 按官方示例准备环境

打开部署来源链接,按官方安装章节配置依赖;依赖与模型版本需保持匹配。

STEP 02 加载指定模型

按同页推理示例加载此模型并处理对应输入;本站未下载权重或执行模型,需在目标设备验证。

查看官方模型资料