中文

面向低资源克丘亚语ASR提升的数据增强

声音 2022-07-15 v1 计算与语言 音频与语音处理

摘要

自动语音识别(ASR)是帮助用户与自动化系统交互的新服务中的关键要素。深度学习方法已使得针对英语ASR部署词错误率低于5%的系统成为可能。然而,这些方法仅适用于拥有数百或数千小时音频及相应转写文本的语言。为使所谓低资源语言能加快可用资源的积累以改进其ASR系统性能,基于现有资源创建新资源的方法正在被研究。本文中,我们描述了用于改进低资源黏着语ASR模型结果的数据增强方法。我们使用wav2letter++模型开展克丘亚语ASR实验。通过我们的方法相对于基线模型将WER降低了8.73%。所得ASR模型取得了22.75%的WER,并使用99小时原始资源与99小时由文本增强与合成语音生成组合得到的合成数据训练。

关键词

引用

@article{arxiv.2207.06872,
  title  = {Data Augmentation for Low-Resource Quechua ASR Improvement},
  author = {Rodolfo Zevallos and Nuria Bel and Guillermo Cámbara and Mireia Farrús and Jordi Luque},
  journal= {arXiv preprint arXiv:2207.06872},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022. arXiv admin note: substantial text overlap with arXiv:2204.00291