中文

PilotTTS:面向竞争性语音合成的严谨模块化配方

声音 2026-05-28 v2 人工智能

摘要

构建前沿文本到语音 (TTS) 系统通常需要数百万小时的专有数据和复杂的多阶段体系结构,为资源受限的研究团队带来了重大障碍。本报告中,我们提出PilotTTS,一个通过极简体系结构和严谨数据工程实现竞争性能的轻量级自回归TTS系统。PilotTTS仅使用20万小时的数据即可训练完成,数据全部使用开源工具加工。我们的具体贡献包括:(1)覆盖质量评估、标签标注和过滤的可复现多阶段数据处理管道;(2)采用Q-Former-based条件化解耦说话人身份与说话风格的紧凑模型体系结构。统一的框架下,PilotTTS支持零样本语音克隆、情感合成(11类)、非语言信息合成(4类)以及中文方言合成(14种方言)。在Seed-TTS Eval基准测试中,PilotTTS在test-en上的最低WER为1.50%,在test-zh上的CER为0.87%,并在两个测试集上获得最高说话人相似度(0.862和0.815),超越了在显著更大数据集上训练的系统。我们在https://github.com/AMAPVOICE/PilotTTS发布完整的数据处理配方、预训练权重和代码。

关键词

引用

@article{arxiv.2605.27258,
  title  = {PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis},
  author = {Bowen Li and Shaotong Guo and Zhen Wang and Yang Xiang and Mingli Jin and Yihang Lin and Jiahui Zhao and Weibo Xiong and Dongrui Zhang and Keming Chen and Yunze Gao and Zeyang Lin and Yuze Zhou and Yue Liu},
  journal= {arXiv preprint arXiv:2605.27258},
  year   = {2026}
}