中文

少数据多利用:使用数据增强改进低资源自动语音识别

计算与语言 2023-05-22 v2 音频与语音处理

摘要

近年来,自动语音识别(ASR)系统的性能取得了实质性进展,特别是对于拥有大量转写语音的语言。遗憾的是,对于低资源语言,如少数民族语言、地区语言或方言,ASR 性能通常仍低得多。在本研究中,我们探究数据增强技术是否有助于提升低资源 ASR 性能,重点关注四种类型学上多样的少数民族语言或语言变体(西日耳曼语:格罗宁根语、西弗里斯语;马来-波利尼西亚语:贝塞马语、纳萨尔语)。对于这四种语言,我们考察了自训练的使用,即利用可用人工转写数据训练的 ASR 系统生成转写文本,再将其与原始数据结合以训练新的 ASR 系统。对于格罗宁根语,由于已有现成的文本转语音(TTS)系统,我们还考察了使用 TTS 从纯文本来源生成 ASR 训练数据。我们发现,使用自训练方法始终带来性能提升(相较于使用 24 分钟人工转写语音训练的 ASR 系统,相对词错率降低最高达 20.5%)。格罗宁根语通过 TTS 增强带来的性能增益更强(相较于基于 24 分钟人工转写语音的系统,词错率相对降低最高达 25.5%)。总之,我们的结果表明,使用自训练或(若可行)TTS 生成的数据,是克服资源稀缺语言数据可用性限制以提升 ASR 性能的高效方案。

关键词

引用

@article{arxiv.2305.10951,
  title  = {Making More of Little Data: Improving Low-Resource Automatic Speech Recognition Using Data Augmentation},
  author = {Martijn Bartelds and Nay San and Bradley McDonnell and Dan Jurafsky and Martijn Wieling},
  journal= {arXiv preprint arXiv:2305.10951},
  year   = {2023}
}

备注

Accepted at ACL 2023