Gemma 4 E2B IT
面向本地设备的指令微调多模态模型,接受文本、图像和音频输入。
最后核实:
https://huggingface.co/google/gemma-4-E2B-it特点与限制
主要特点
- PLE逐层嵌入
- 原生128K上下文
- 支持system角色与可配置思考模式
- 音频转写与图像理解
使用边界
- E2B命名代表有效参数口径,实际权重不等同于2B稠密模型。
- 模型输出为文本,音频输入能力不代表音频生成。
- 不同语言与任务效果需要目标场景验证。
模型信息
- 家族与版本
- Gemma / 4
- 输入与输出
- 文本、图像、音频 → 文本
- 公开参数规模
- 5.1B(以以下来源口径为准)
- 激活 / 有效参数
- 未提供 / 2.3B
- 参数口径
- 官方E2B表格:2.3B effective,含嵌入表为5.1B;PLE嵌入采用查表方式,有效参数不等于MoE激活参数。视觉编码器另列约150M、音频编码器约300M,5.1B不被当作全部多模态组件的合计。 参数来源
- 原生上下文
- 131,072 tokens
- 扩展上下文
- 未提供
- 语言声明
- 多语言(预训练覆盖140余种;官方称开箱支持35余种);语言支持不代表对应语言的评测水平。
- 权重许可
- Apache-2.0
- 代码许可
- 未核实
- 训练资料
- 官方提供模型卡或技术报告;未公开完整训练数据清单。
能力依据
模型变体:指令版;家族与版本:Gemma / 4
文本生成 仅官方依据
MMLU Pro60%官方报告 · en查看评估与来源收起补充信息
文本生成 仅官方依据
MMLU Pro60%官方报告 · en
可作为英语知识问答候选:官方 MMLU Pro 成绩为 60.0%。该指标不能说明中文长文写作或事实回答可靠性。
已有依据支持
- 已登记一项英语知识与推理基准的官方成绩。
证据限制
- MMLU Pro 单项考试成绩不能替代目标场景验证。
- 本站未运行模型验证实际对话表现。
MMLU Pro · 60%官方报告 · Google DeepMind
展开评测条件与来源
- 模型标识 / 修订
- google/gemma-4-E2B-it / 未提供
- 思考模式
- 未知
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- MMLU Pro / 未提供
- 基准 / 报告版本
- 官方模型卡未注明数据版本
- Few-shot / 输出上限
- 未提供 / 未提供 tokens
- 提示模板 / 设置
- 未提供;Google 官方卡的 instruction-tuned 表列 Gemma 4 E2B 为 60.0%。未披露该行的 few-shot、提示模板、输出长度和推理模式;本站未复现。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://huggingface.co/google/gemma-4-E2B-it
- 来源使用说明
- 引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
- 比较状态
- 不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。
代码 仅官方依据
LiveCodeBench v644%官方报告 · code查看评估与来源收起补充信息
代码 仅官方依据
LiveCodeBench v644%官方报告 · code
可作为需执行测试核验的代码生成候选:官方 LiveCodeBench v6 成绩为 44.0%。单一基准不能保证复杂项目修改正确。
已有依据支持
- 官方报告包含该型号的代码生成基准成绩。
证据限制
- 复杂项目修改仍需在目标仓库运行测试验证。
- 提示、采样和生成长度等条件未完整披露。
LiveCodeBench v6 · 44%官方报告 · Google DeepMind
展开评测条件与来源
- 模型标识 / 修订
- google/gemma-4-E2B-it / 未提供
- 思考模式
- 未知
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- LiveCodeBench / 未提供
- 基准 / 报告版本
- v6
- Few-shot / 输出上限
- 未提供 / 未提供 tokens
- 提示模板 / 设置
- 未提供;Google 官方卡的 instruction-tuned 表列 Gemma 4 E2B 为 44.0%。未披露该行的 few-shot、提示模板、输出长度和推理模式;本站未复现。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://huggingface.co/google/gemma-4-E2B-it
- 来源使用说明
- 引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
- 比较状态
- 不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。
视觉理解 仅官方依据
MMMU Pro44.2%官方报告 · en查看评估与来源收起补充信息
视觉理解 仅官方依据
MMMU Pro44.2%官方报告 · en
可作为图文问答候选:官方 MMMU Pro 成绩为 44.2%。该单项视觉推理结果不能保证 OCR 准确或细节图像识别效果。
已有依据支持
- 官方报告提供多模态视觉推理基准数据。
证据限制
- OCR 与细节识别需要按目标图像另行验证。
- 本站未使用本地图片输入验证识图效果。
MMMU Pro · 44.2%官方报告 · Google DeepMind
展开评测条件与来源
- 模型标识 / 修订
- google/gemma-4-E2B-it / 未提供
- 思考模式
- 未知
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- MMMU Pro / 未提供
- 基准 / 报告版本
- 官方模型卡未注明数据版本
- Few-shot / 输出上限
- 未提供 / 未提供 tokens
- 提示模板 / 设置
- 未提供;Google 官方卡视觉表列 Gemma 4 E2B 为 44.2%。未披露该行的few-shot、提示模板、输出长度和推理模式;本站未复现。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://huggingface.co/google/gemma-4-E2B-it
- 来源使用说明
- 引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
- 比较状态
- 不可比:官方卡未披露该成绩的模型revision、推理模式及具体评测配置,无法与统一条件下的其他成绩比较。
语音识别 仅官方依据
FLEURS ASR0.08比率官方报告 · en查看评估与来源收起补充信息
语音识别 仅官方依据
FLEURS ASR0.08比率官方报告 · en
可作为英语语音转写候选:官方 FLEURS 英语行的 WER 为 0.080(越低越好)。该数据只说明报告所列英语测试结果。
已有依据支持
- 官方报告提供一项明确区分 WER 与 CER 的语音识别结果。
证据限制
- 该结果不能代表其他语言或本站音频的实际识别效果。
- 音频与解码配置不足以复现统一条件比较。
FLEURS ASR · 0.08(比率)官方报告 · Google DeepMind
展开评测条件与来源
- 模型标识 / 修订
- google/gemma-4-E2B-it / 未提供
- 思考模式
- 不适用
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- FLEURS / 未提供
- 基准 / 报告版本
- 官方技术报告 Table 7
- Few-shot / 输出上限
- 未提供 / 未提供 tokens
- 提示模板 / 设置
- 未提供;Google 官方技术报告将英文列为 WER,Gemma 4 E2B 数值为 0.080。其他测试语言中带星号的列使用 CER;此记录只取英文 WER。报告未给出该行的模型revision、few-shot、提示模板或生成长度;本站未复现。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://arxiv.org/html/2607.02770
- 来源使用说明
- 引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖报告原文或第三方内容许可。 查看说明
- 比较状态
- 不可比:报告给出了数据集、英文列和WER指标,但未披露模型revision及足以统一复测的音频、解码和提示配置。
运行条件与获取
Transformers
系统支持未提供 · Safetensors · 未指定量化
官方支持;本站尚未进行推理验证。
硬件:未核实。本站未实测;内存、显存和速度取决于运行时、精度、输入长度与硬件,不将参数量或文件大小换算为资源保证。
内存:未核实;显存:未核实。
依赖:transformers(官方要求最新版)、torch、accelerate、torchvision(图像输入)、librosa(音频输入)。
STEP 01 按官方示例准备环境
打开部署来源链接,按官方安装章节配置依赖;依赖与模型版本需保持匹配。
STEP 02 加载指定模型
按同页推理示例加载此模型并处理对应输入;本站未下载权重或执行模型,需在目标设备验证。