中文

探索模型合并在多域ASR中的潜力与局限性

计算与语言 2026-03-06 v1 音频与语音处理

摘要

模型合并是多任务训练的可扩展替代方案,将多个专用模型的能力组合到单个模型中。这对于大型语音基础模型尤为吸引人,因为这些模型通常通过领域特定微调进行适应,导致多个定制化检查点,而新数据可用时进行完整微调则代价高昂。本文研究了模型合并用于多域ASR,对11种合并算法进行基准测试,覆盖10个欧洲葡萄牙语领域,评估领域内准确率、分布迁移下的鲁棒性,以及英语和多语言性能。我们进一步提出了BoostedTSV-M算法,基于TSV-M通过奇点值提升缓解秩崩溃,提高数值稳定性。总体而言,我们的方法在欧洲葡萄牙语上优于完整微调,同时保持了跨域泛化。

关键词

引用

@article{arxiv.2603.05354,
  title  = {Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR},
  author = {Carlos Carvalho and Francisco Teixeira and Thomas Rolland and Alberto Abad},
  journal= {arXiv preprint arXiv:2603.05354},
  year   = {2026}
}

备注

submitted for review for INTERSPEECH2026 conference