RapFlow-TTS:基于改进一致性流匹配的快速高保真文本语音合成
音频与语音处理
2025-06-23 v1 人工智能
摘要
我们介绍 RapFlow-TTS,一种利用流匹配 (FM) 训练中速度一致性约束实现快速高保真语音合成的模型。虽然基于常数微分方程 (ODE) 的语音生成实现了自然质量的语音,但通常需要大量生成步骤,导致质量与推理速度之间存在权衡。为此,我们通过在 FM 直线 ODE 轨迹上的速度场施加一致性,实现了更少的生成步骤即可获得一致的合成质量。此外,我们引入了时间间隔调度和对抗学习等技术进一步提升少步合成的质量。实验结果表明,RapFlow-TTS 在合成步骤减少 5 倍(相对于常规 FM 方法)和 10 倍(相对于基于评分的方法)的情况下,仍实现了高保真语音合成。
引用
@article{arxiv.2506.16741,
title = {RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching},
author = {Hyun Joon Park and Jeongmin Liu and Jin Sob Kim and Jeong Yeol Yang and Sung Won Han and Eunwoo Song},
journal= {arXiv preprint arXiv:2506.16741},
year = {2025}
}
备注
Accepted on Interspeech 2025