中文

Audio-AdapterFusion:一种无任务 ID 的高效无损多任务语音识别方法

计算与语言 2023-10-23 v1 人工智能 音频与语音处理

摘要

适配器是对预训练模型进行全量微调的一种高效、可组合的替代方案,并有助于将大型 ASR 模型扩展到许多任务。在实践中,推理时通常在输入前附加一个任务 ID,以路由到指定任务的单任务适配器。然而,该方法的一个主要局限是推理时可能未知任务 ID,使其不适用于大多数多任务场景。为此,我们提出三种新颖的无任务 ID 方法来组合多任务 ASR 中的单任务适配器,并研究了两种用于训练的学习算法。我们在来自 4 个不同 ASR 任务的 10 个测试集上评估了我们的方法,结果表明我们的方法是无损且参数高效的。在仅更新 17% 的模型参数时,我们的方法相对于全量微调可实现 8% 的平均 WER 提升,并与任务 ID 适配器路由相当。

关键词

引用

@article{arxiv.2310.13015,
  title  = {Audio-AdapterFusion: A Task-ID-free Approach for Efficient and Non-Destructive Multi-task Speech Recognition},
  author = {Hillary Ngai and Rohan Agrawal and Neeraj Gaur and Ronny Huang and Parisa Haghani and Pedro Moreno Mengibar},
  journal= {arXiv preprint arXiv:2310.13015},
  year   = {2023}
}

备注

2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) Proceedings