中文

面向端到端语码转换语音识别的数据增强

计算与语言 2024-11-05 v2 音频与语音处理

摘要

训练语码转换端到端自动语音识别(ASR)模型通常需要大量数据,而语码转换数据往往有限。本文提出三种新颖的语码转换数据增强方法。具体而言,分别为:利用已有语码转换数据进行音频拼接,以及通过词翻译或词插入生成新语码转换文本后进行TTS(文本转语音)。我们在200小时中英混合语码转换数据集上的实验表明,三种所提方法均能单独显著提升语码转换ASR性能。此外,所有方法均可与近期流行的SpecAugment结合使用,并获得额外增益。相较于无任何数据增强的系统,词错率(WER)相对降低24.0%,即便与仅使用SpecAugment的系统相比仍有相对13.0%的增益。

关键词

引用

@article{arxiv.2011.02160,
  title  = {Data Augmentation for End-to-end Code-switching Speech Recognition},
  author = {Chenpeng Du and Hao Li and Yizhou Lu and Lan Wang and Yanmin Qian},
  journal= {arXiv preprint arXiv:2011.02160},
  year   = {2024}
}

备注

Accepted to SLT 2021