超越双阶段扩散TTS:通过跳跃扩散实现结构与内容的联合细化
音频与语音处理
2026-03-17 v1
摘要
扩散和流匹配TTS面临离散时间结构与连续谱建模之间的张力。两阶段模型在固定对齐上扩散,常坍缩为平均韵律;单阶段模型避免显式时长,但 suffer alignment instability。我们提出一种跳跃扩散框架,其中离散跳跃建模时间结构,连续扩散在一个过程中细化谱内容。即使在其单次退化形式下,该框架相对于Grad-TTS的3.37% WER(原4.38%)实现了改进,在LJSpeech上改进了UTMOSv2。更完整的迭代UDD变体进一步实现了自适应韵律,自动在分布外慢速语音中插入自然停顿,而不是均匀拉伸。音频样本可在https://anonymousinterpseech.github.io/TTS_Demo/上访问。
引用
@article{arxiv.2603.14032,
title = {Beyond Two-stage Diffusion TTS: Joint Structure and Content Refinement via Jump Diffusion},
author = {Jiabao Ai and Minghui Zhao and Anton Ragni},
journal= {arXiv preprint arXiv:2603.14032},
year = {2026}
}
备注
5 pages, 5 figures. Audio samples available at https://anonymousinterpseech.github.io/TTS_Demo/