中文

用于非典型与口音语音ASR自适应的参数高效残差适配器

计算与语言 2021-09-16 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)系统通常优化以在具有规范语音模式的说话人上表现最佳。不幸的是,这些系统在测试非典型语音和重口音语音时表现不佳。先前研究表明,通过模型微调的个性化可大幅改善性能。然而,为每个说话人维护如此大的模型成本高且难以扩展。我们表明,通过所谓的残差适配器向编码器层添加相对较少的额外参数,相较于模型微调可实现相似的自适应增益,同时仅更新极小部分(小于0.5%)的模型参数。我们在两个语音自适应任务(非典型与口音语音)上以及两种最先进ASR架构上展示了这一点。

关键词

引用

@article{arxiv.2109.06952,
  title  = {Residual Adapters for Parameter-Efficient ASR Adaptation to Atypical and Accented Speech},
  author = {Katrin Tomanek and Vicky Zayats and Dirk Padfield and Kara Vaillancourt and Fadi Biadsy},
  journal= {arXiv preprint arXiv:2109.06952},
  year   = {2021}
}

备注

Accepted to EMNLP 2021