IndexTTS 2.5技术报告
声音
2026-01-12 v3 人工智能
摘要
在先前的工作中,我们引入了IndexTTS 2,一个零样本神经文本到语音基础模型,由两个核心组件组成:基于Transformer的文本到语义(T2S)模块和非自回归语义到频谱(S2M)模块,两者共同实现了对情感的忠实复制,并建立了第一个自回归时长可控生成范式。基于此,我们提出IndexTTS 2.5,通过四项关键改进显著提升了多语言覆盖范围、推理速度和整体合成质量:1)语义编码压缩:我们将语义编码帧率从50Hz降低到25Hz,减半序列长度,显著降低了训练和推理成本;2)架构升级:我们将S2M模块基于U-DiT的背部替换为更高效的Zipformer-based建模架构,实现了显著的参数减少和更快的频谱生成;3)多语言扩展:我们提出了三个明确的跨语言建模策略:边界感知对齐、token级拼接和指令引导生成,确立了零样本多语言情感语音的实用设计原则,支持中文、英文、日文和西班牙文,并即使在没有目标语言情感训练数据的情形下也能实现稳健的情感传递;4)强化学习优化:我们在T2S模块的后训练中应用了GRPO,提高了发音准确性和自然度。实验表明,IndexTTS 2.5不仅支持更广泛的语言覆盖,还能在相同的零样本设置下复制未见语言的情感语音。IndexTTS 2.5在RTF上实现了2.28倍的提升,同时保持与IndexTTS 2相当的WER和说话人相似度。
引用
@article{arxiv.2601.03888,
title = {IndexTTS 2.5 Technical Report},
author = {Yunpei Li and Xun Zhou and Jinchao Wang and Lu Wang and Yong Wu and Siyi Zhou and Yiquan Zhou and Jingchen Shu},
journal= {arXiv preprint arXiv:2601.03888},
year = {2026}
}
备注
11 pages, 4 figures