ItôTTS 与 ItôWave:线性随机微分方程即为音频生成之所需
声音
2022-02-01 v5 音频与语音处理
摘要
在本文中,我们提出将语音合成的两个方面,即文本到语音(TTS)与声码器,基于一对正向与反向时间的线性随机微分方程(SDE)统一到一个框架中。该 SDE 对的解是两个随机过程,其中之一将我们想要生成的梅尔频谱图(或波形)的分布转化为一个简单且易处理的分布;另一个则是生成过程,将该易处理的简单信号转化为目标梅尔频谱图(或波形)。生成梅尔频谱图的模型称为 ItôTTS,生成波形的模型称为 ItôWave。ItôTTS 和 ItôWave 以维纳过程作为驱动,在原始文本或梅尔频谱图的条件输入下,从噪声信号中逐步减去多余信号,分别生成逼真的对应有意义的梅尔频谱图和音频。实验结果表明,ItôTTS 和 ItôWave 的平均意见得分(MOS)可超越当前最先进方法,分别达到 3.9250.160 和 4.350.115。生成的音频样本可在 https://wushoule.github.io/ItoAudio/ 获取。所有作者对本工作贡献均等。
引用
@article{arxiv.2105.07583,
title = {It\^oTTS and It\^oWave: Linear Stochastic Differential Equation Is All You Need For Audio Generation},
author = {Shoule Wu and Ziqiang Shi},
journal= {arXiv preprint arXiv:2105.07583},
year = {2022}
}
备注
The generated audio samples are available at https://wushoule.github.io/ItoAudio/