基于流匹配的零样本TTS噪声鲁棒性研究
音频与语音处理
2024-06-11 v1 人工智能
信号处理
摘要
近年来,能够从短音频提示合成任何说话者声音的零样本文本转语音(TTS)系统取得了快速进展。然而,当音频提示包含噪声时,生成语音的质量会显著下降,并且针对此问题的研究有限。在本文中,我们探索了在基于流匹配的零样本TTS背景下,从含噪音频提示中增强生成音频质量的各种策略。我们的研究包括全面的训练策略:使用掩蔽语音去噪进行无监督预训练、对预训练数据进行多说话者检测和基于DNSMOS的数据过滤,以及使用随机噪声混合进行微调。我们的实验结果表明,与对音频提示应用语音增强的方法相比,在可懂度、说话者相似度和整体音频质量方面都有显著提升。
引用
@article{arxiv.2406.05699,
title = {An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS},
author = {Xiaofei Wang and Sefik Emre Eskimez and Manthan Thakker and Hemin Yang and Zirun Zhu and Min Tang and Yufei Xia and Jinzhu Li and Sheng Zhao and Jinyu Li and Naoyuki Kanda},
journal= {arXiv preprint arXiv:2406.05699},
year = {2024}
}
备注
Accepted to INTERSPEECH2024