中文

MAGIC-TTS:基于显式局部时长和停顿控制的细粒度可控语音合成

声音 2026-04-28 v2

摘要

细粒度的局部时长控制在现代语音合成系统中仍然缺失:现有方法通常仅提供句子级时长或全局说话速度控制,而对精确的 token 级别时长操作尚不可用。据我们所知,MAGIC-TTS 是首个具备显式局部时长控制能力的 TTS 模型,能够对 token 级别的内容时长和停顿进行控制。MAGIC-TTS 的实现得益于显式的 token 级别时长条件化、精心准备的高置信度时长监督信息,以及纠正零值偏差、使模型对缺失的局部控制具有鲁棒性的训练机制。在我们的时长控制基准测试中,MAGIC-TTS 在 token 级别的时长和停顿跟随方面显著优于随机合成。即使在未提供时长控制的情况下,MAGIC-TTS 也能保持自然的高质量合成。我们进一步评估了针对实际场景的局部编辑,包括导航指导、导读和面向无障碍的代码阅读。在该设置下,MAGIC-TTS 实现了可重复的统一时长基线,然后将编辑区域移动到请求的局部目标位置,平均偏差极低。这些结果表明,显式的细粒度可控性可以在高质量的 TTS 系统中有效实现,并且可以支持真实的局部时长编辑应用。

关键词

引用

@article{arxiv.2604.21164,
  title  = {MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control},
  author = {Jialong Mai and Xiaofen Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2604.21164},
  year   = {2026}
}

备注

Release MAGIC-TTS code, pretrained models, and demo: https://github.com/yongaifadian1/MAGIC-TTS, https://huggingface.co/maimai11/MAGIC-TTS, https://yongaifadian1.github.io/MAGIC-TTS/