中文

MegaTTS 3:稀疏对齐增强的潜在扩散Transformer用于零样图语音合成

音频与语音处理 2025-03-31 v4 机器学习 声音

摘要

虽然近期零样文本语音合成 (TTS) 模型在语音质量和表达性方面取得了显著进步,但主流系统仍因语音-文本对齐建模问题存在局限:1)缺乏显式语音-文本对齐建模的模型鲁性较差,尤其在实际应用中的困难句子;2)基于预定义对齐的模型受限于强制对齐的自然性。本文引入\textit{MegaTTS 3},其特色为创新性稀疏对齐算法引导潜在扩散Transformer (DiT)。具体而言,我们为MegaTTS 3 提供稀疏对齐边界,以降低对齐难度而不限制搜索空间,从而实现高自然性。此外,我们采用多条件无条件引导策略实现语调强度调节,并采用分段整流流技术加速生成过程。实验表明,MegaTTS 3 在零样图语音质量方面达到最先进水平,支持对语调强度进行高度灵活的控制。值得注意的是,本系统仅需8次采样步即可生成高质量的1分钟语音。音频样本已在 https://sditdemo.github.io/sditdemo/ 上提供。

关键词

引用

@article{arxiv.2502.18924,
  title  = {MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis},
  author = {Ziyue Jiang and Yi Ren and Ruiqi Li and Shengpeng Ji and Boyang Zhang and Zhenhui Ye and Chen Zhang and Bai Jionghao and Xiaoda Yang and Jialong Zuo and Yu Zhang and Rui Liu and Xiang Yin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2502.18924},
  year   = {2025}
}