用于非典型与口音语音ASR自适应的参数高效残差适配器
计算与语言
2021-09-16 v1 声音
音频与语音处理
摘要
自动语音识别(ASR)系统通常优化以在具有规范语音模式的说话人上表现最佳。不幸的是,这些系统在测试非典型语音和重口音语音时表现不佳。先前研究表明,通过模型微调的个性化可大幅改善性能。然而,为每个说话人维护如此大的模型成本高且难以扩展。我们表明,通过所谓的残差适配器向编码器层添加相对较少的额外参数,相较于模型微调可实现相似的自适应增益,同时仅更新极小部分(小于0.5%)的模型参数。我们在两个语音自适应任务(非典型与口音语音)上以及两种最先进ASR架构上展示了这一点。
引用
@article{arxiv.2109.06952,
title = {Residual Adapters for Parameter-Efficient ASR Adaptation to Atypical and Accented Speech},
author = {Katrin Tomanek and Vicky Zayats and Dirk Padfield and Kara Vaillancourt and Fadi Biadsy},
journal= {arXiv preprint arXiv:2109.06952},
year = {2021}
}
备注
Accepted to EMNLP 2021