中文

超越双阶段扩散TTS:通过跳跃扩散实现结构与内容的联合细化

音频与语音处理 2026-03-17 v1

摘要

扩散和流匹配TTS面临离散时间结构与连续谱建模之间的张力。两阶段模型在固定对齐上扩散,常坍缩为平均韵律;单阶段模型避免显式时长,但 suffer alignment instability。我们提出一种跳跃扩散框架,其中离散跳跃建模时间结构,连续扩散在一个过程中细化谱内容。即使在其单次退化形式下,该框架相对于Grad-TTS的3.37% WER(原4.38%)实现了改进,在LJSpeech上改进了UTMOSv2。更完整的迭代UDD变体进一步实现了自适应韵律,自动在分布外慢速语音中插入自然停顿,而不是均匀拉伸。音频样本可在https://anonymousinterpseech.github.io/TTS_Demo/上访问。

关键词

引用

@article{arxiv.2603.14032,
  title  = {Beyond Two-stage Diffusion TTS: Joint Structure and Content Refinement via Jump Diffusion},
  author = {Jiabao Ai and Minghui Zhao and Anton Ragni},
  journal= {arXiv preprint arXiv:2603.14032},
  year   = {2026}
}

备注

5 pages, 5 figures. Audio samples available at https://anonymousinterpseech.github.io/TTS_Demo/