Kokoro-82M
将文本合成为24kHz语音的轻量模型,语言和声音需配套选择。
最后核实:
https://huggingface.co/hexgrad/Kokoro-82M特点与限制
主要特点
- 8200万参数
- 多语言与多声音
- 官方Python KPipeline推理接口
使用边界
- 非英语数据或G2P支持可能不足;不同声音质量差异较大。
- 官方声音说明称100至200 token较合适,过短或超过400 token的长句可能变差,应分段。
- LLM式文本上下文长度不适用;不提供未经核实的token上限。
模型信息
- 家族与版本
- Kokoro / 1.0
- 输入与输出
- 文本 → 音频
- 公开参数规模
- 0.082B(以以下来源口径为准)
- 激活 / 有效参数
- 未提供 / 未提供
- 参数口径
- 官方模型卡声明8200万参数;v1.0发表于2025-01-27。 参数来源
- 原生上下文
- 不适用
- 扩展上下文
- 不适用
- 语言声明
- 英语(美式、英式)、日语、普通话、西班牙语、法语、印地语、意大利语、巴西葡萄牙语;语言支持不代表对应语言的评测水平。
- 权重许可
- Apache-2.0
- 代码许可
- Apache-2.0
- 训练资料
- 官方披露数百小时许可或非版权音频、IPA标签及合成数据,并列Koniwa与SIWIS的CC BY归属;未发布完整训练数据集。
能力依据
模型变体:专用版;家族与版本:Kokoro / 1.0
语音合成 证据不足
暂无可靠公开成绩
查看评估与来源收起补充信息
语音合成 证据不足
暂无可靠公开成绩
本轮未找到许可明确、评测协议公开且可确认评测者独立的Kokoro-82M语音质量数据,暂不据零散榜单或AA成绩判断音质高低。
证据限制
- 模型卡列出的语言和声音属于功能说明,不是质量评测证据。
- 试听自然度会随语种、音色、文本长度、G2P、运行时与量化变化;需要同条件听测或可复现MOS评测。
- AA数据仅链接原站,本记录没有导入其数值。
暂无该用途的公开评测成绩;不能从其他用途或缺失值推断能力。
运行条件与获取
Kokoro
Windows、Linux、macOS · PyTorch checkpoint · 未指定量化
官方支持;本站尚未进行推理验证。
硬件:未核实。本站未实测;内存、显存和速度取决于运行时、精度、输入长度与硬件,不将参数量或文件大小换算为资源保证。
内存:未核实;显存:未核实。
依赖:kokoro>=0.9.4、torch、soundfile、espeak-ng、misaki[ja](日语)、misaki[zh](中文)。
STEP 01 安装 Python 依赖
在独立 Python 环境执行官方 Usage 的依赖安装。此处将 Colab 的 pip 写法转换为终端命令,并给版本条件加引号。espeak-ng 与中文、日语 G2P 依赖需按官方 Advanced Usage 和操作系统另行安装;本命令不等于完整部署,本站未执行模型。
python -m pip install "kokoro>=0.9.4" soundfileSTEP 02 加载指定模型
按同页推理示例加载此模型并处理对应输入;本站未下载权重或执行模型,需在目标设备验证。