语音合成的下一 token 去噪
声音
2025-08-04 v2 计算与语言
音频与语音处理
摘要
虽然扩散模型和自回归 (AR) 模型在生成建模方面取得了显著进展,但二者各自存在不同局限。AR 模型依赖因果注意力,无法利用未来上下文,且生成速度较慢;而扩散模型则在 key-value (KV) 缓存方面存在困难。为克服这些挑战,我们提出 Dragon-FM,一种新的文本到语音 (TTS) 设计,融合 AR 和 flow-matching。该模型以 12.5 秒每百万 token 的紧凑速率处理 48 kHz 音频 codec token。该设计使模型能够跨块实现 AR 建模,确保全局一致性,同时在块内实现并行 flow-matching 以实现快速迭代去噪。因此,模型可跨块利用 KV 缓存,并在每个块内利用双向上下文。此外,它连接连续特征建模与离散特征建模,证明连续 AR flow-matching 可预测离散 token,采用有限标量量化器。这种高效 codec 和快速块级自回归架构也使模型在生成长篇内容(如播客)方面效果显著。在播客数据集上的实验表明,其能够高效生成高质量的零样本播客。
关键词
引用
@article{arxiv.2507.22746,
title = {Next Tokens Denoising for Speech Synthesis},
author = {Yanqing Liu and Ruiqing Xue and Chong Zhang and Yufei Liu and Gang Wang and Bohan Li and Yao Qian and Lei He and Shujie Liu and Sheng Zhao},
journal= {arXiv preprint arXiv:2507.22746},
year = {2025}
}