探索模型合并在多域ASR中的潜力与局限性
计算与语言
2026-03-06 v1 音频与语音处理
摘要
模型合并是多任务训练的可扩展替代方案,将多个专用模型的能力组合到单个模型中。这对于大型语音基础模型尤为吸引人,因为这些模型通常通过领域特定微调进行适应,导致多个定制化检查点,而新数据可用时进行完整微调则代价高昂。本文研究了模型合并用于多域ASR,对11种合并算法进行基准测试,覆盖10个欧洲葡萄牙语领域,评估领域内准确率、分布迁移下的鲁棒性,以及英语和多语言性能。我们进一步提出了BoostedTSV-M算法,基于TSV-M通过奇点值提升缓解秩崩溃,提高数值稳定性。总体而言,我们的方法在欧洲葡萄牙语上优于完整微调,同时保持了跨域泛化。
引用
@article{arxiv.2603.05354,
title = {Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR},
author = {Carlos Carvalho and Francisco Teixeira and Thomas Rolland and Alberto Abad},
journal= {arXiv preprint arXiv:2603.05354},
year = {2026}
}
备注
submitted for review for INTERSPEECH2026 conference