中文

ReFlow-TTS:一种用于高保真文本到语音的修正流模型

声音 2024-02-01 v2 音频与语音处理

摘要

包括去噪扩散概率模型(DDPM)和基于分数的生成模型在内的扩散模型在语音合成任务中展现了优异性能。然而,其有效性以众多采样步骤为代价,导致合成高质量语音所需采样时间较长。这一缺陷阻碍了其在真实场景中的实际适用性。本文中,我们提出 ReFlow-TTS,一种基于修正流(rectified flow)的高保真语音合成新方法。具体而言,我们的 ReFlow-TTS 仅是一个常微分方程(ODE)模型,其通过尽可能沿直线路径将高斯分布传输至真实 Mel 谱图分布。此外,我们所提方法能够以单步采样实现高质量语音合成,且无需训练教师模型。我们在 LJSpeech 数据集上的实验表明,我们的 ReFlow-TTS 方法相较于其他基于扩散的模型取得了最佳性能。并且,采用单步采样的 ReFlow-TTS 与现有单步 TTS 模型相比具有竞争力。

关键词

引用

@article{arxiv.2309.17056,
  title  = {ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech},
  author = {Wenhao Guan and Qi Su and Haodong Zhou and Shiyu Miao and Xingjia Xie and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2309.17056},
  year   = {2024}
}

备注

Accepted at ICASSP2024