中文

利用适配器进行跨语言低资源语音识别

计算与语言 2021-12-21 v2 声音 音频与语音处理

摘要

跨语言语音自适应旨在解决利用多种富资源语言为低资源目标语言构建模型的问题。由于低资源语言训练数据有限,语音识别模型容易过拟合。本文提出使用适配器来研究多种适配器在参数高效的跨语言语音自适应中的性能。基于我们此前隐式利用适配器的MetaAdapter,我们提出了一种称为SimAdapter的新算法,用于显式地从适配器中学习知识。我们的算法利用可轻松集成到Transformer结构中的适配器。MetaAdapter借助元学习将训练数据中的通用知识迁移到测试语言。SimAdapter旨在微调期间利用适配器学习源语言与目标语言之间的相似性。我们在Common Voice数据集的五种低资源语言上进行了大量实验。结果表明,与强大的全模型微调基线相比,我们的MetaAdapter和SimAdapter方法仅使用2.5%和15.5%的可训练参数便能将WER降低2.98%和2.55%。此外,我们还表明这两种新算法可集成以获得更好性能,相对WER最高降低3.55%。

关键词

引用

@article{arxiv.2105.11905,
  title  = {Exploiting Adapters for Cross-lingual Low-resource Speech Recognition},
  author = {Wenxin Hou and Han Zhu and Yidong Wang and Jindong Wang and Tao Qin and Renjun Xu and Takahiro Shinozaki},
  journal= {arXiv preprint arXiv:2105.11905},
  year   = {2021}
}

备注

Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP) as a full paper; 12 pages; code at https://github.com/jindongwang/transferlearning/tree/master/code/ASR/Adapter