中文

利用未转写的域外数据提升低资源语音识别性能

计算与语言 2021-06-03 v1 声音 音频与语音处理

摘要

半监督训练(SST)是一种利用未转写/无标签语音数据来改善低资源语言自动语音识别性能的常用方法。然而,如果可用的无标签语音与目标域不匹配,SST的效果就不佳,并且在许多情况下比原始系统表现更差。在本文中,我们解决当目标语言中仅有现成的未转写域外语音数据时低资源ASR的问题。具体而言,我们旨在利用网络资源(特别是更接近新闻/专题广播数据的YouTube数据)来改善会话/电话语音(目标域)上的性能。借助SST,我们表明,虽然在某些情况下简单地将域外数据与训练数据混合会降低词错误率(WER),但在所有情况下,如果我们先使用域外数据训练,然后用原始训练数据微调所得模型,都能看到性能提升。每种目标语言使用2000小时速度扰动的YouTube音频及半监督转写文本,我们在多个语言/数据集上展示了相对于基线系统最高16.3%的WER相对提升,以及相对于简单混合域外数据与训练数据的系统最高7.4%的WER相对提升。

关键词

引用

@article{arxiv.2106.01227,
  title  = {Improving low-resource ASR performance with untranscribed out-of-domain data},
  author = {Jayadev Billa},
  journal= {arXiv preprint arXiv:2106.01227},
  year   = {2021}
}