中文

用于ASR增强的非平行语音转换

声音 2022-09-16 v1 机器学习 音频与语音处理

摘要

自动语音识别(ASR)需要对说话人差异具有鲁棒性。语音转换(VC)修改输入语音的说话人特征。这是ASR数据增强的一个吸引人的特性。在本文中,我们证明语音转换可用作数据增强技术以改善ASR性能,即使在包含2,456名说话人的LibriSpeech上也是如此。对于ASR增强,VC模型必须对大范围的输入语音具有鲁棒性。这促使我们使用非自回归、非平行的VC模型,并在VC模型内使用预训练的ASR编码器。本工作表明,尽管包含许多说话人,说话人多样性可能仍是ASR质量的一个限制。最后,对我们VC性能的探究提供了用于VC质量客观评估的有用指标。

关键词

引用

@article{arxiv.2209.06987,
  title  = {Non-Parallel Voice Conversion for ASR Augmentation},
  author = {Gary Wang and Andrew Rosenberg and Bhuvana Ramabhadran and Fadi Biadsy and Yinghui Huang and Jesse Emond and Pedro Moreno Mengibar},
  journal= {arXiv preprint arXiv:2209.06987},
  year   = {2022}
}

备注

Accepted by Interspeech 2022