纯 CPU 浏览器 ONNX 推理 · GitHub Pages 部署

MOSS-TTS-Nano

一个 0.1B 参数的多语言文字转语音模型,完全在你的浏览器中运行。 无需服务器、无需 GPU —— 模型已预置在仓库中,打开页面即可使用。 支持声音克隆、流式解码和 20 种语言。

模型源

功能说明:设置 ONNX 模型文件的根目录路径。模型已预置在仓库的 models/ 目录下,默认填写即可。

使用步骤:① 确认路径 → ② 点击「加载并准备」加载模型 → ③ 加载完成后前往「语音」区域开始合成。

当前选择

尚未选择路径。

点击 加载并准备 预加载分词器、ONNX 推理会话并执行预热。 模型文件位于仓库的 models/MOSS-TTS-Nano-100M-ONNXmodels/MOSS-Audio-Tokenizer-Nano-ONNX 目录中。

生成选项

功能说明:控制 TTS 合成的各项参数。更改后即时生效,下次合成时使用新参数。

建议:保持默认值即可获得良好效果。如需调整,请参考每个选项的说明。

WeTextProcessing 更精确的多语言文本正则化处理(如数字、符号规范化)。
文本规范化 对输入文本进行预处理,提升合成质量。

固定采样帧 使用专用快速路径,其固定超参数为: 文本温度 1.0 / top-p 1.0 / top-k 50,音频温度 0.8 / top-p 0.95 / top-k 25 / 重复惩罚 1.2。 全采样 则使用完整的逐 token 采样流程。

语音选择

功能说明:选择内置或已上传的语音音色,输入要合成的文本,点击按钮开始生成。

使用步骤:① 选择语音 → ② 选择或输入文本 → ③ 点击「非流式合成」或「实时流式解码」。

区别:非流式合成等待全部生成完毕后播放;流式解码边生成边播放,首音延迟更低。

上传语音

功能说明:上传你自己的参考音频,编码为声音克隆用的提示音频编码,保存到浏览器本地存储中。

使用步骤:① 填写显示名称和分组 → ② 选择参考音频文件(.wav/.mp3/.flac 等)→ ③ 点击「编码并保存」。

注意:上传的语音编码后保存在浏览器本地存储中,不会上传到任何服务器。

上传的语音会在本地编码为提示音频编码并保存到浏览器存储中,你可以在不同会话中复用这些自定义语音。 所有处理均在本地浏览器中完成,不会上传到任何服务器。

状态与日志

说明:此处显示当前运行状态、已准备的文本以及详细的运行日志。日志以 [时间戳] 格式记录每一步操作。

当前命令解释

等待操作…

页面已就绪,请先在「模型源」区域点击「加载并准备」来加载模型。

已准备文本

尚未准备文本。
尚未准备文本。

运行日志