Schrödinger 桥在文本到语音合成中胜过扩散模型
机器学习
2024-02-09 v1 声音
音频与语音处理
摘要
在文本到语音 (TTS) 合成中,扩散模型已取得了有前景的生成质量。然而,由于预定义的从数据到噪声的扩散过程,其先验分布被限制为噪声表示,这几乎不提供关于生成目标的信息。在本工作中,我们提出了一种新颖的 TTS 系统 Bridge-TTS,首次尝试用干净且确定性的先验替代现有基于扩散的 TTS 方法中的高斯噪声先验,该先验提供了目标的强结构信息。具体而言,我们利用从文本输入获得的潜在表示作为先验,并在其与真实 mel 频谱图之间构建了一个完全可处理的 Schrödinger 桥,从而形成数据到数据的过程。此外,我们公式的可处理性和灵活性使我们能够实证研究诸如噪声调度等设计空间,以及开发随机和确定性采样器。在 LJ-Speech 数据集上的实验结果证明了我们的方法在合成质量和采样效率方面的有效性,在 50 步/1000 步合成中显著优于扩散对应模型 Grad-TTS,在少步场景中优于强大的快速 TTS 模型。项目页面:https://bridge-tts.github.io/
引用
@article{arxiv.2312.03491,
title = {Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis},
author = {Zehua Chen and Guande He and Kaiwen Zheng and Xu Tan and Jun Zhu},
journal= {arXiv preprint arXiv:2312.03491},
year = {2024}
}