中文

用于多语言语音识别与翻译的低秩与稀疏模型合并

声音 2025-07-09 v3 人工智能 计算与语言 音频与语音处理

摘要

语言多样性给语音到文本 (S2T) 任务(如自动语音识别和翻译)带来了重大挑战。传统的多语言多任务训练方法旨在通过跨多种语言联合优化多个语音识别和翻译任务来解决此问题。虽然基于这些策略构建的模型(如 Whisper)表现出色,但它们仍面临计算成本高、语言干扰、训练配置欠佳以及可扩展性有限等问题。为了克服这些挑战,我们引入了 LoRS-Merging(低秩与稀疏模型合并),这是一种新技术,旨在高效整合在不同语言或任务上训练的模型,同时保持性能并降低计算开销。LoRS-Merging 结合了低秩和稀疏剪枝,以保留基本结构并消除冗余参数,从而缓解语言干扰并增强可扩展性。在 10 种语言上的实验结果表明,LoRS-Merging 显著优于多语言多任务训练、顺序训练及其他合并方法,在归一化性能上实现了超过 20% 的提升。我们的研究结果表明,模型合并(尤其是 LoRS-Merging)是传统多语言训练策略在 S2T 应用中一种可扩展且有效的补充。

关键词

引用

@article{arxiv.2502.17380,
  title  = {Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation},
  author = {Qiuming Zhao and Guangzhi Sun and Chao Zhang},
  journal= {arXiv preprint arXiv:2502.17380},
  year   = {2025}
}

备注

13 pages