LongCat-AudioDiT:波形潜空间中的高保真扩散文本转语音
声音
2026-04-01 v1 音频与语音处理
摘要
我们提出了 LongCat-AudioDiT,一种新颖的非自回归基于扩散的文本转语音(TTS)模型,达到了最先进的(SOTA)性能。与先前依赖中间声学表示(如 mel 频谱图)的方法不同,LongCat-AudioDiT 的核心创新在于直接在波形潜空间中操作。该方法有效减少了误差累积,并大幅简化了 TTS 流水线,仅需一个波形变分自编码器(Wav-VAE)和一个扩散主干网络。此外,我们引入了两个对推理过程的关键改进:首先,我们识别并修正了一个长期存在的训练-推理不匹配问题;其次,我们用自适应投影引导替代了传统的无分类器引导,以提升生成质量。实验结果表明,尽管缺乏复杂的多阶段训练流水线或高质量人工标注数据集,LongCat-AudioDiT 在 Seed 基准上实现了 SOTA 零样本声音克隆性能,同时保持了有竞争力的可懂度。具体而言,我们最大的变体 LongCat-AudioDiT-3.5B 超越了先前的 SOTA 模型(Seed-TTS),在 Seed-ZH 上将说话人相似度(SIM)分数从 0.809 提升至 0.818,在 Seed-Hard 上从 0.776 提升至 0.797。最后,通过全面的消融实验和系统分析,我们验证了所提模块的有效性。特别地,我们研究了 Wav-VAE 与 TTS 主干网络之间的相互作用,揭示了一个反直觉的发现:Wav-VAE 中更优的重构保真度并不必然带来更好的整体 TTS 性能。代码和模型权重已发布,以促进语音社区内的进一步研究。
引用
@article{arxiv.2603.29339,
title = {LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space},
author = {Detai Xin and Shujie Hu and Chengzuo Yang and Chen Huang and Guoqiao Yu and Guanglu Wan and Xunliang Cai},
journal= {arXiv preprint arXiv:2603.29339},
year = {2026}
}
备注
Code and model weights are available at https://github.com/meituan-longcat/LongCat-AudioDiT