中文

在极低资源环境下语音转换可改善语音识别

音频与语音处理 2022-06-22 v2 计算与语言 声音

摘要

在低资源语言中,可以通过使用语音转换 (VC) 来扩充有限的训练数据,从而改善语音识别系统。然而,由于计算速度以及在未见过的说话人之间进行转换时的局限性等实际问题,VC 并未被广泛用于此目的。此外,目前尚不清楚在一种资源丰富的语言上训练的 VC 模型是否可以应用于另一种低资源语言的语音,以实现数据扩充的目的。在本工作中,我们评估了 VC 系统是否可以跨语言使用以改善低资源语音识别。我们结合了几种最新技术,设计并用英语训练了一个实用的 VC 系统,然后使用该系统为多种低资源语言的语音识别模型训练扩充数据。当使用合理数量的 VC 扩充数据时,所考虑的四种低资源语言的语音识别性能均得到提升。我们还表明,在所考虑的低资源语言中,基于 VC 的数据扩充优于 SpecAugment(一种广泛使用的信号处理扩充方法)。

关键词

引用

@article{arxiv.2111.02674,
  title  = {Voice Conversion Can Improve ASR in Very Low-Resource Settings},
  author = {Matthew Baas and Herman Kamper},
  journal= {arXiv preprint arXiv:2111.02674},
  year   = {2022}
}

备注

5 page, 4 tables, 2 figures. Accepted at Interspeech 2022