中文

面向由粗到细文本到语音合成的浅层流匹配

音频与语音处理 2025-10-24 v2 人工智能 声音

摘要

我们提出了浅层流匹配(SFM),这是一种新颖的机制,可在由粗到细的生成范式下增强基于流匹配(FM)的文本到语音(TTS)模型。与传统的FM模块将来自弱生成器的粗粒度表示作为条件不同,SFM从这些表示出发,沿FM路径构建中间状态。在训练期间,我们引入了一种正交投影方法来自适应地确定这些状态的时间位置,并应用了一种基于单段分段流的原理性构建策略。SFM推理从中间状态而非纯噪声开始,从而将计算集中在FM路径的后半段。我们将SFM通过一个轻量级的SFM头集成到多个TTS模型中。实验表明,SFM在客观和主观评估中均能持续提升语音自然度,并且在使用自适应步长常微分方程求解器时显著加速了推理过程。演示和代码可在https://ydqmkkx.github.io/SFMDemo/获取。

关键词

引用

@article{arxiv.2505.12226,
  title  = {Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis},
  author = {Dong Yang and Yiyi Cai and Yuki Saito and Lixu Wang and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2505.12226},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025