返回模型目录
文本生成代码

Qwen3-4B

4B级通用指令模型,支持思考切换;长上下文需要额外启用YaRN配置。

最后核实:

https://huggingface.co/Qwen/Qwen3-4B

特点与限制

主要特点

  • 官方标注4.0B总参数、3.6B非嵌入参数
  • 原生32K上下文
  • 官方说明YaRN可扩展至128K

使用边界

  • 128K是YaRN扩展能力,需匹配运行时配置。
  • 本站未复现评测或设备表现。

模型信息

家族与版本
Qwen / 3
输入与输出
文本 → 文本
公开参数规模
4B(以以下来源口径为准)
激活 / 有效参数
未提供 / 未提供
参数口径
官方卡标注总参数4.0B、非嵌入参数3.6B。 参数来源
原生上下文
32,768 tokens
扩展上下文
131,072 tokens;YaRN可扩展至131072 tokens;需推理框架配置RoPE scaling,不建议短上下文默认开启。
语言声明
多语言(官方称支持100余种语言与方言);语言支持不代表对应语言的评测水平。
权重许可
Apache-2.0
代码许可
未核实
训练资料
模型卡和技术报告提供训练与后训练概述,未提供完整可复核的逐样本训练集清单。

能力依据

模型变体:指令版;家族与版本:Qwen / 3

文本生成 官方与第三方交叉核实

MMLU-Pro58%官方报告 · en · 思考关闭
MMLU-Redux83.7%官方报告 · en · 思考开启
MMLU-Redux77.3%官方报告 · en · 思考关闭
查看评估与来源收起补充信息 · 共 7 项成绩

官方表格分别报告Thinking与Non-thinking模式的MMLU-Redux(83.7% / 77.3%)和GPQA Diamond(55.9% / 41.7%);推理模式与知识问答成绩相关,单项考试不能代表中文写作或日常对话。Epoch AI另对精确型号做了GPQA Diamond内部评测;其导出标签和分数可核验,但思考设置与部署配置没有完整披露,不能据此宣布严格同条件复现。

已有依据支持
  • 同一技术报告分别列出明确尺寸的思考与非思考结果。
  • 有Epoch AI独立GPQA评测记录,可作为外部参照。
证据限制
  • 两种模式数值不同,使用时应按提示模板与推理预算选择。
  • 报告没有披露足够完整的每项生成配置,本站未复现。
  • 英文基准不能直接代表中文长文写作。

MMLU-Pro · 58%官方报告 · Qwen Team

score · 越高越好 · en

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
MMLU-Pro / 未提供
基准 / 报告版本
官方卡未注明数据版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen 官方 Qwen3-4B-Instruct-2507 卡的对照表单独列出旧版 Qwen3-4B Non-Thinking,数值为 58.0。此记录取该旧版列,不取新版 2507 列。shot数、prompt、采样和输出长度未在表内披露;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
比较状态
不可比:官方对照表明确标为原 Qwen3-4B Non-Thinking,但未给模型revision及完整评测参数,不能与其他评测条件不明的记录统一比较。

MMLU-Redux · 83.7%官方报告 · Qwen Team

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
MMLU-Redux / 未提供
基准 / 报告版本
未单独标注基准版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 17,精确型号 Qwen3-4B,Thinking 模式。 报告未完整给出该行的模型revision、提示模板、采样与输出预算。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

MMLU-Redux · 77.3%官方报告 · Qwen Team

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
MMLU-Redux / 未提供
基准 / 报告版本
未单独标注基准版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 18,精确型号 Qwen3-4B,Non-thinking 模式。 报告未完整给出该行的模型revision、提示模板、采样与输出预算。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

GPQA Diamond · 55.9%官方报告 · Qwen Team

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
GPQA Diamond / 未提供
基准 / 报告版本
未单独标注基准版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 17,精确型号 Qwen3-4B,Thinking 模式。 报告未完整给出该行的模型revision、提示模板、采样与输出预算。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

GPQA Diamond · 41.7%官方报告 · Qwen Team

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
GPQA Diamond / 未提供
基准 / 报告版本
未单独标注基准版本
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 18,精确型号 Qwen3-4B,Non-thinking 模式。 报告未完整给出该行的模型revision、提示模板、采样与输出预算。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

GPQA Diamond · 52.34%第三方评测 · Epoch AI

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
qwen3-4b / 未提供
思考模式
未知
量化 / 运行时
未提供 / 未提供
数据集 / 划分
GPQA Diamond / 未提供
基准 / 报告版本
Epoch AI internal run, 2026-08
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Epoch AI gpqa_diamond.csv 原始model_version=qwen3-4b,mean_score=0.5233585858585859,stderr=0.030102242301033352;折算显示为 52.34% ± 3.01 个百分点(标准误)。该来源未在导出元数据中明确模型思考模式、部署运行时和完整提示参数;见原始运行记录。
评测日期 / 核实日期
2026-08-28 / 2026-10-02
来源
https://logs.epoch.ai/inspect-viewer/36231d6d/viewer.html?log_file=https%3A%2F%2Flogs.epoch.ai%2Finspect_ai_logs%2FG3dinPvwrci2Nu3m9pby2i.eval
来源使用说明
开放数据;许可:CC BY 4.0;Epoch AI基准数据页说明数据可按CC BY 4.0署名后使用和再分发;本条保留Epoch AI署名及运行记录链接。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

GPQA Diamond · 43.56%第三方评测 · Epoch AI

accuracy · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
qwen3-4b_none / 未提供
思考模式
未知
量化 / 运行时
未提供 / 未提供
数据集 / 划分
GPQA Diamond / 未提供
基准 / 报告版本
Epoch AI internal run, 2026-08
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Epoch AI gpqa_diamond.csv 原始model_version=qwen3-4b_none,mean_score=0.4356060606060606,stderr=0.026892896738900395;折算显示为 43.56% ± 2.69 个百分点(标准误)。该来源未在导出元数据中明确模型思考模式、部署运行时和完整提示参数;见原始运行记录。
评测日期 / 核实日期
2026-08-28 / 2026-10-02
来源
https://logs.epoch.ai/inspect-viewer/36231d6d/viewer.html?log_file=https%3A%2F%2Flogs.epoch.ai%2Finspect_ai_logs%2FSLJyD8yew4TxcmprJfVvuE.eval
来源使用说明
开放数据;许可:CC BY 4.0;Epoch AI基准数据页说明数据可按CC BY 4.0署名后使用和再分发;本条保留Epoch AI署名及运行记录链接。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

代码 官方与第三方交叉核实

LiveCodeBench v626.4%官方报告 · code · 思考关闭
LiveCodeBench v554.2%官方报告 · code · 思考开启
LiveCodeBench v521.3%官方报告 · code · 思考关闭
查看评估与来源收起补充信息 · 共 5 项成绩

官方Qwen3技术报告给出LiveCodeBench v5 Thinking 54.2% 与 Non-thinking 21.3%;结果随推理模式明显变化,不能直接当成项目级代码修改成功率。HuggingFaceTB另在LiveCodeBench v4零样本表列出本型号两种模式的成绩;版本题目范围不同,不能与v5结果直接排名。

已有依据支持
  • 官方报告覆盖竞赛式代码生成,且明确区分思考模式。
  • 另一独立模型卡给出LiveCodeBench v4零样本结果。
证据限制
  • LiveCodeBench只覆盖算法题,不等价于仓库级工程任务。
  • v4与v5题目窗口和评测实现不同,不能按数值直接比较。
  • 提示、运行时和输出长度并未全部披露,本站未执行代码验证。

LiveCodeBench v6 · 26.4%官方报告 · Qwen Team

score · 越高越好 · code

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench / 未提供
基准 / 报告版本
v6(25.02-25.05)
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen 官方 Qwen3-4B-Instruct-2507 卡的对照表单独列出旧版 Qwen3-4B Non-Thinking,数值为 26.4。此记录取该旧版列,不取新版 2507 列。shot数、prompt、采样和输出长度未在表内披露;本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507
来源使用说明
引用来源;许可:未提供;仅摘录少量评测事实并署名链接,不覆盖模型卡原文或第三方内容许可。 查看说明
比较状态
不可比:官方对照表明确标为原 Qwen3-4B Non-Thinking,但未给模型revision及完整评测参数,不能与其他评测条件不明的记录统一比较。

LiveCodeBench v5 · 54.2%官方报告 · Qwen Team

pass@1 score · 越高越好 · code · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench v5 / 未提供
基准 / 报告版本
v5(题目期 2024.10–2025.02)
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 17,精确型号 Qwen3-4B,Thinking 模式。技术报告说明LiveCodeBench v5采用 2024.10–2025.02 题目;该记录的提示、采样和输出上限未完整披露。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

LiveCodeBench v5 · 21.3%官方报告 · Qwen Team

pass@1 score · 越高越好 · code · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench v5 / 未提供
基准 / 报告版本
v5(题目期 2024.10–2025.02)
Few-shot / 输出上限
未提供 / 未提供 tokens
提示模板 / 设置
未提供;Qwen3技术报告 Table 18,精确型号 Qwen3-4B,Non-thinking 模式。技术报告说明LiveCodeBench v5采用 2024.10–2025.02 题目;该记录的提示、采样和输出上限未完整披露。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://arxiv.org/html/2505.09388v1
来源使用说明
引用来源;许可:未提供;少量引用Qwen技术报告中的评测事实;评测结果及报告采用何种许可未由模型权重Apache-2.0许可自动覆盖。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

LiveCodeBench v4 · 24.9%第三方评测 · Hugging FaceTB

score · 越高越好 · code · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench v4 / 未提供
基准 / 报告版本
v4(SmolLM3模型卡对照表)
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB/SmolLM3-3B模型卡的Qwen3对照表,No Extended Thinking模式;全表注明zero-shot,并使用LightEval。模型卡没有披露此行更细的采样、题目时间窗和生成长度。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅引用该模型卡表格中的少量成绩事实。SmolLM3权重或代码许可不自动授权转载第三方模型成绩,故按事实引用并保留来源链接。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

LiveCodeBench v4 · 52.9%第三方评测 · Hugging FaceTB

score · 越高越好 · code · 摘要引用

展开评测条件与来源
模型标识 / 修订
Qwen/Qwen3-4B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench v4 / 未提供
基准 / 报告版本
v4(SmolLM3模型卡对照表)
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB/SmolLM3-3B模型卡的Qwen3对照表,Extended Thinking模式;全表注明zero-shot,并使用LightEval。模型卡没有披露此行更细的采样、题目时间窗和生成长度。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅引用该模型卡表格中的少量成绩事实。SmolLM3权重或代码许可不自动授权转载第三方模型成绩,故按事实引用并保留来源链接。 查看说明
比较状态
不可比:来源没有披露可复现比较所需的模型revision、运行时或完整提示与生成配置;保留原始来源上下文,不与其他记录排名。

运行条件与获取

Transformers

系统支持未提供 · Safetensors · 未指定量化

官方支持;本站尚未进行推理验证。

硬件:未核实。本站未实测;内存、显存和速度取决于精度、输入、运行时与硬件,不从参数量或文件体积推算资源保证。

内存:未核实;显存:未核实。

依赖:transformers(最新版)、torch。

STEP 01 准备运行环境

安装当前兼容的 PyTorch 与 Transformers;按目标设备选择 PyTorch 配置。

python -m pip install -U transformers torch

STEP 02 加载模型

从官方卡加载 Qwen/Qwen3-4B;仅在需要长上下文时按卡片配置YaRN。

查看官方模型资料