用于ASR增强的非平行语音转换
声音
2022-09-16 v1 机器学习
音频与语音处理
摘要
自动语音识别(ASR)需要对说话人差异具有鲁棒性。语音转换(VC)修改输入语音的说话人特征。这是ASR数据增强的一个吸引人的特性。在本文中,我们证明语音转换可用作数据增强技术以改善ASR性能,即使在包含2,456名说话人的LibriSpeech上也是如此。对于ASR增强,VC模型必须对大范围的输入语音具有鲁棒性。这促使我们使用非自回归、非平行的VC模型,并在VC模型内使用预训练的ASR编码器。本工作表明,尽管包含许多说话人,说话人多样性可能仍是ASR质量的一个限制。最后,对我们VC性能的探究提供了用于VC质量客观评估的有用指标。
引用
@article{arxiv.2209.06987,
title = {Non-Parallel Voice Conversion for ASR Augmentation},
author = {Gary Wang and Andrew Rosenberg and Bhuvana Ramabhadran and Fadi Biadsy and Yinghui Huang and Jesse Emond and Pedro Moreno Mengibar},
journal= {arXiv preprint arXiv:2209.06987},
year = {2022}
}
备注
Accepted by Interspeech 2022