中文

M3-TTS:多模态DiT对齐与Mel潜变量用于零样本高保真语音合成

声音 2025-12-05 v1

摘要

非自回归(NAR)文本到语音合成依赖文本序列与音频表征之间的长度对齐,限制了自然度和表现力。现有方法依赖时长建模或伪对齐策略,严重限制了自然度和计算效率。我们提出M3-TTS,一种基于多模态扩散变换器(MM-DiT)架构的简洁高效NAR TTS范式。M3-TTS采用联合扩散变换器层进行跨模态对齐,在不依赖伪对齐要求的情况下实现可变长文本-语音序列的稳定单调对齐。单个扩散变换器层进一步增强声学细节建模。该框架集成了mel-vae编解码器,提供3倍训练加速。在Seed-TTS和AISHELL-3基准上的实验结果表明,M3-TTS以最低的词错误率(英语1.36%,中文1.31%)实现了最先进的NAR性能,同时保持了有竞争力的自然度分数。代码和演示将在https://wwwwxp.github.io/M3-TTS上公开。

关键词

引用

@article{arxiv.2512.04720,
  title  = {M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis},
  author = {Xiaopeng Wang and Chunyu Qiang and Ruibo Fu and Zhengqi Wen and Xuefei Liu and Yukun Liu and Yuzhe Liang and Kang Yin and Yuankun Xie and Heng Xie and Chenxing Li and Chen Zhang and Changsheng Li},
  journal= {arXiv preprint arXiv:2512.04720},
  year   = {2025}
}

备注

Submitted to ICASSP 2026