中文

MOSS-TTS 技术报告

声音 2026-03-23 v2 人工智能 计算与语言

摘要

本技术报告介绍了 MOSS-TTS,一款基于可扩展配方构建的语音生成基础模型:离散音频标记、自回归建模和大规模预训练。基于 MOSS-Audio-Tokenizer——一种将 24 kHz 音频压缩至 12.5 fps 且支持可变比特率 RVQ 的因果 Transformer 标记化器,我们发布了两种互补的生成器:MOSS-TTS 侧重结构简洁、可扩展性和长时序/控制导向部署;MOSS-TTS-Local-Transformer 引入帧级自回归模块,实现更高的建模效率、更强的说话人保持能力以及更快的首音延迟。跨多语言和开放域场景,MOSS-TTS 支持零样语音克隆、标记级时长控制、音素/拼音级发音控制、平滑代码切换以及稳定的长文本生成。本报告总结了所发布模型的设计、训练配方及实证特征。

关键词

引用

@article{arxiv.2603.18090,
  title  = {MOSS-TTS Technical Report},
  author = {Yitian Gong and Botian Jiang and Yiwei Zhao and Yucheng Yuan and Kuangwei Chen and Yaozhou Jiang and Cheng Chang and Dong Hong and Mingshu Chen and Ruixiao Li and Yiyang Zhang and Yang Gao and Hanfu Chen and Ke Chen and Songlin Wang and Xiaogui Yang and Yuqian Zhang and Kexin Huang and ZhengYuan Lin and Kang Yu and Ziqi Chen and Jin Wang and Zhaoye Fei and Qinyuan Cheng and Shimin Li and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2603.18090},
  year   = {2026}
}

备注

Project page: https://github.com/OpenMOSS/MOSS-TTS