通过建模残差多模态提升 FastSpeech 2 的鲁棒性
声音
2024-09-19 v1 计算与语言
机器学习
音频与语音处理
摘要
基于 FastSpeech 2 的最先进非自回归文本到语音(TTS)模型能够高效合成高保真且自然的语音。然而,对于富有表现力的语音数据集,我们观察到典型的音频失真。我们证明此类伪影是由过平滑的梅尔谱预测引入声码器重建的,而该预测源于训练梅尔谱解码器时采用的均方误差(MSE)损失。在 MSE 损失下,FastSpeech 2 仅限于学习训练分布的条件平均值;若在所有条件信号之后分布仍呈多模态,该平均值可能并不接近自然样本。为缓解此问题,我们引入 TVC-GMM,一种三变量链高斯分布的混合模型,以建模残差多模态。如客观与主观评测所示,TVC-GMM 降低了谱图平滑度,并特别针对富有表现力的数据集提升了感知音频质量。
引用
@article{arxiv.2306.01442,
title = {Towards Robust FastSpeech 2 by Modelling Residual Multimodality},
author = {Fabian Kögel and Bac Nguyen and Fabien Cardinaux},
journal= {arXiv preprint arXiv:2306.01442},
year = {2024}
}
备注
Accepted at INTERSPEECH 2023