面向由粗到细文本到语音合成的浅层流匹配
音频与语音处理
2025-10-24 v2 人工智能
声音
摘要
我们提出了浅层流匹配(SFM),这是一种新颖的机制,可在由粗到细的生成范式下增强基于流匹配(FM)的文本到语音(TTS)模型。与传统的FM模块将来自弱生成器的粗粒度表示作为条件不同,SFM从这些表示出发,沿FM路径构建中间状态。在训练期间,我们引入了一种正交投影方法来自适应地确定这些状态的时间位置,并应用了一种基于单段分段流的原理性构建策略。SFM推理从中间状态而非纯噪声开始,从而将计算集中在FM路径的后半段。我们将SFM通过一个轻量级的SFM头集成到多个TTS模型中。实验表明,SFM在客观和主观评估中均能持续提升语音自然度,并且在使用自适应步长常微分方程求解器时显著加速了推理过程。演示和代码可在https://ydqmkkx.github.io/SFMDemo/获取。
引用
@article{arxiv.2505.12226,
title = {Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis},
author = {Dong Yang and Yiyi Cai and Yuki Saito and Lixu Wang and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2505.12226},
year = {2025}
}
备注
Accepted by NeurIPS 2025