Whisper medium
Whisper medium多语言语音识别档,支持语音转写与翻译到英语。
最后核实:
https://github.com/openai/whisper特点与限制
主要特点
- 约769M参数
- 多语言识别及翻译到英语
- 30秒音频片段可按官方分块流程处理长音频
使用边界
- 长音频需分块;30秒音频窗口不是token上下文。
- 识别表现需按目标语言和音频验证;本站未复现WER。
模型信息
- 家族与版本
- Whisper / medium
- 输入与输出
- 音频 → 文本
- 公开参数规模
- 0.769B(以以下来源口径为准)
- 激活 / 有效参数
- 未提供 / 未提供
- 参数口径
- OpenAI Whisper仓库模型表列769M参数,换算为0.769B;不是权重文件体积。 参数来源
- 原生上下文
- 不适用
- 扩展上下文
- 不适用
- 语言声明
- 多语言(含中文;仓库另有英语专用档);语言支持不代表对应语言的评测水平。
- 权重许可
- MIT
- 代码许可
- MIT
- 训练资料
- OpenAI仓库说明其以约680,000小时弱标注语音训练;未给出完整逐样本可复核的训练语料清单。
能力依据
模型变体:专用版;家族与版本:Whisper / medium
语音识别 仅官方依据
Whisper原论文附录D.211.6%官方报告 · 印度尼西亚语Whisper原论文附录D.2.223.2%官方报告 · 中文Whisper原论文附录D.2.410.2%官方报告 · 印度尼西亚语查看评估与来源收起补充信息
语音识别 仅官方依据
Whisper原论文附录D.211.6%官方报告 · 印度尼西亚语
Whisper原论文附录D.2.223.2%官方报告 · 中文
Whisper原论文附录D.2.410.2%官方报告 · 印度尼西亚语
可作为多语言语音转写候选:OpenAI原论文报告了该档在Common Voice 9印尼语、中文及FLEURS印尼语上的零样本成绩。中文数值按论文预处理说明应读作CER;公开数据只支持这些语种和测试集,不代表目标音频或部署表现。
已有依据支持
- 原论文直接列出多语言Whisper medium型号结果,没有借用英语专用版或蒸馏版。
- 同一论文同时给出Common Voice 9与FLEURS印尼语成绩,以及中文字符错误率参考。
证据限制
- 目前只有模型发布方原论文报告,未找到相同型号及条件的独立复测。
- 论文表格未完整说明revision、解码配置和精确split;不同音频分布需重新测试。
- Common Voice 9中文表头标作WER,但附录C说明中文按字符分隔,故值等效CER,不能与普通WER直接比较。
Whisper原论文附录D.2 · 11.6%官方报告 · OpenAI(论文作者及模型发布方)
展开评测条件与来源
- 模型标识 / 修订
- Whisper medium(多语言版) / 未提供
- 思考模式
- 不适用
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- Common Voice 9 / 未提供
- 基准 / 报告版本
- OpenAI Whisper论文 Table 11(Common Voice 9)
- Few-shot / 输出上限
- 0 / 未提供 tokens
- 提示模板 / 设置
- 未提供;论文报告的多语言Whisper medium 零样本结果;附录未完整列明此行的模型revision、解码参数和评测split标识。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://cdn.openai.com/papers/whisper.pdf
- 来源使用说明
- 引用来源;许可:未提供;仅记录论文中的少量型号成绩并链接原始论文;不复制论文表格、音频或基准数据,引用不更改论文或数据集许可。 查看说明
- 比较状态
- 不可比:来源未披露足以复现和统一对齐的完整模型revision及推理配置;该结果仅记录原报告口径,不加入跨型号比较组。
Whisper原论文附录D.2.2 · 23.2%官方报告 · OpenAI(论文作者及模型发布方)
展开评测条件与来源
- 模型标识 / 修订
- Whisper medium(多语言版) / 未提供
- 思考模式
- 不适用
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- Common Voice 9 / 未提供
- 基准 / 报告版本
- OpenAI Whisper论文 Table 11(Common Voice 9)
- Few-shot / 输出上限
- 0 / 未提供 tokens
- 提示模板 / 设置
- 未提供;论文表格以WER标题列值;附录C说明中文等无空格语言会在字符间加空格,因此该值实为等效CER。多语言Whisper medium 零样本;revision、解码参数及split标识未完整列明。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://cdn.openai.com/papers/whisper.pdf
- 来源使用说明
- 引用来源;许可:未提供;仅记录论文中的少量型号成绩并链接原始论文;不复制论文表格、音频或基准数据,引用不更改论文或数据集许可。 查看说明
- 比较状态
- 不可比:来源未披露足以复现和统一对齐的完整模型revision及推理配置;该结果仅记录原报告口径,不加入跨型号比较组。
Whisper原论文附录D.2.4 · 10.2%官方报告 · OpenAI(论文作者及模型发布方)
展开评测条件与来源
- 模型标识 / 修订
- Whisper medium(多语言版) / 未提供
- 思考模式
- 不适用
- 量化 / 运行时
- 未提供 / 未提供
- 数据集 / 划分
- FLEURS / 未提供
- 基准 / 报告版本
- OpenAI Whisper论文 Table 13(FLEURS)
- Few-shot / 输出上限
- 0 / 未提供 tokens
- 提示模板 / 设置
- 未提供;论文报告的多语言Whisper medium 零样本结果;附录未完整列明此行的模型revision、解码参数和评测split标识。
- 评测日期 / 核实日期
- 未提供 / 2026-10-02
- 来源
- https://cdn.openai.com/papers/whisper.pdf
- 来源使用说明
- 引用来源;许可:未提供;仅记录论文中的少量型号成绩并链接原始论文;不复制论文表格、音频或基准数据,引用不更改论文或数据集许可。 查看说明
- 比较状态
- 不可比:来源未披露足以复现和统一对齐的完整模型revision及推理配置;该结果仅记录原报告口径,不加入跨型号比较组。
运行条件与获取
OpenAI Whisper
系统支持未提供 · OpenAI Whisper checkpoint · 未指定量化
官方支持;本站尚未进行推理验证。
硬件:未核实。本站未实测;内存、显存和速度取决于精度、输入、运行时与硬件,不从参数量或文件体积推算资源保证。
内存:未核实;显存:未核实。
依赖:openai-whisper、ffmpeg。
STEP 01 准备运行环境
安装OpenAI Whisper包并准备ffmpeg;按设备安装兼容的PyTorch。
python -m pip install -U openai-whisperSTEP 02 加载模型
使用 whisper.load_model('medium') 加载,并调用transcribe处理音频。