中文

低资源场景下使用跨语言多说话人TTS与跨语言语音转换的ASR数据增强

音频与语音处理 2023-05-23 v5 计算与语言 声音

摘要

我们探索将跨语言多说话人语音合成与跨语言语音转换应用于低/中资源场景下自动语音识别(ASR)系统的数据增强。通过大量实验,我们表明我们的方法允许仅使用一名目标语言说话人在模型训练时应用语音合成与语音转换来改进ASR系统。与其他使用多名说话人的工作相比,我们还缩小了以合成语音与以人类语音训练的ASR模型之间的差距。最后,我们展示利用我们的数据增强方法,仅使用一名目标语言真实说话人即可获得有前景的ASR训练结果。

关键词

引用

@article{arxiv.2204.00618,
  title  = {ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversion},
  author = {Edresson Casanova and Christopher Shulby and Alexander Korolev and Arnaldo Candido Junior and Anderson da Silva Soares and Sandra Aluísio and Moacir Antonelli Ponti},
  journal= {arXiv preprint arXiv:2204.00618},
  year   = {2023}
}

备注

This paper was accepted at INTERSPEECH 2023