返回模型目录
文本生成代码

SmolLM3-3B

3B指令模型,突出混合推理、长上下文与公开训练配置。

最后核实:

https://huggingface.co/HuggingFaceTB/SmolLM3-3B

特点与限制

主要特点

  • 支持混合推理
  • 训练64K,上探128K用YaRN
  • 官方列出六种原生支持语言

使用边界

  • 六种原生语言为英、法、西、德、意、葡;metadata不代表其他语言有同等支持。
  • 128K依赖YaRN和运行时配置。
  • 本站未复现评测或设备表现。

模型信息

家族与版本
SmolLM / 3
输入与输出
文本 → 文本
公开参数规模
3B(以以下来源口径为准)
激活 / 有效参数
未提供 / 未提供
参数口径
官方卡将其描述为3B参数级,摘要未给更精确总参数。 参数来源
原生上下文
65,536 tokens
扩展上下文
131,072 tokens;卡片称训练使用64K,上探至128K需YaRN外推。
语言声明
英语、法语、西班牙语、德语、意大利语、葡萄牙语;语言支持不代表对应语言的评测水平。
权重许可
Apache-2.0
代码许可
未核实
训练资料
模型卡公开训练数据混合与训练配置;未逐条列明所有样本来源。

能力依据

模型变体:指令版;家族与版本:SmolLM / 3

文本生成 仅官方依据

IFEval76.7%官方报告 · en · 思考关闭
Global MMLU53.5%官方报告 · multilingual · 思考关闭
IFEval71.2%官方报告 · en · 思考开启
查看评估与来源收起补充信息 · 共 4 项成绩

官方 zero-shot 表报告 Global MMLU 关闭思考为 53.5%、开启扩展思考为 64.1%;IFEval 则分别为 76.7% 和 71.2%。结果显示模式会改变不同任务的表现,不能把单一模式成绩泛化为整体对话质量。

已有依据支持
  • 官方将两种 extended thinking 设置分表报告,可观察模式变化。
  • Global MMLU 提供多语言知识问答信号。
证据限制
  • Global MMLU 汇总分不说明中文单独表现;不能用其替代中文专项评测。
  • 开启思考并未令 IFEval 同步提升;运行成本和输出长度也未在该分数中体现。

IFEval · 76.7%官方报告 · HuggingFaceTB

score · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
IFEval / 未提供
基准 / 报告版本
官方模型卡未注明基准版本
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 No Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

Global MMLU · 53.5%官方报告 · HuggingFaceTB

score · 越高越好 · multilingual · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
Global MMLU / 未提供
基准 / 报告版本
官方模型卡未注明基准版本
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 No Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

IFEval · 71.2%官方报告 · HuggingFaceTB

score · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
IFEval / 未提供
基准 / 报告版本
官方模型卡未注明基准版本
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

Global MMLU · 64.1%官方报告 · HuggingFaceTB

score · 越高越好 · multilingual · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
Global MMLU / 未提供
基准 / 报告版本
官方模型卡未注明基准版本
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

代码 仅官方依据

LiveCodeBench15.2%官方报告 · en · 思考关闭
LiveCodeBench30%官方报告 · en · 思考开启
查看评估与来源收起补充信息

官方 LiveCodeBench v4 zero-shot 分数为关闭思考 15.2%、开启扩展思考 30.0%;说明此基准对思考模式敏感,但不代表任意代码任务成功率。

已有依据支持
  • 同一官方评测来源报告了两种模式,可明确呈现模式差异。
证据限制
  • 仓库内复杂代码修改仍需真实运行测试验证。
  • 评测者为模型发布方,尚无独立复测;采样和生成预算未充分披露。

LiveCodeBench · 15.2%官方报告 · HuggingFaceTB

score · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
关闭
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench / 未提供
基准 / 报告版本
v4
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 No Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

LiveCodeBench · 30%官方报告 · HuggingFaceTB

score · 越高越好 · en · 摘要引用

展开评测条件与来源
模型标识 / 修订
HuggingFaceTB/SmolLM3-3B / 未提供
思考模式
启用
量化 / 运行时
未提供 / 未提供
数据集 / 划分
LiveCodeBench / 未提供
基准 / 报告版本
v4
Few-shot / 输出上限
0 / 未提供 tokens
提示模板 / 设置
未提供;HuggingFaceTB 官方卡说明评测使用 lighteval,除非另有说明均为 zero-shot;该行分属 Extended Thinking 表。本站未复现。
评测日期 / 核实日期
未提供 / 2026-10-02
来源
https://huggingface.co/HuggingFaceTB/SmolLM3-3B
来源使用说明
引用来源;许可:未提供;仅摘录少量官方评测事实并署名链接;模型权重Apache-2.0不代表评测表数据自动采用相同许可。 查看说明
比较状态
不可比:官方卡未披露权重revision、提示模板、生成预算及完整解码条件,且扩展思考模式必须与关闭模式分开比较。

运行条件与获取

Transformers

系统支持未提供 · Safetensors · 未指定量化

官方支持;本站尚未进行推理验证。

硬件:未核实。本站未实测;内存、显存和速度取决于精度、输入、运行时与硬件,不从参数量或文件体积推算资源保证。

内存:未核实;显存:未核实。

依赖:transformers>=4.53.0、torch。

STEP 01 准备运行环境

使用 Transformers 4.53.0 或更新版本,并安装兼容的 PyTorch。

python -m pip install -U transformers torch

STEP 02 加载模型

加载 HuggingFaceTB/SmolLM3-3B;扩展至128K时按卡片设置YaRN。

查看官方模型资料