基于聚焦-反馈-修复的迭代 LoRA 训练方法用于多语言语音识别
计算与语言
2025-07-14 v1
摘要
大型语言模型与自动语音识别系统的深度集成已成为具有高度实际应用价值的热门研究方向。为解决低秩适应(LoRA)在监督微调(SFT)阶段常见的过拟合问题,本文提出了结合迭代伪标记策略的创新性训练范式——迭代 LoRA 训练(ILT),有效提升模型性能的理论上限。基于 Whisper-large-v3 和 Qwen2-Audio,我们进行了系统性实验,采用三阶段训练流程:聚焦训练、反馈训练和修复训练。实验结果表明,所提方法有效。此外,MegaAIS 研究团队将此技术应用于 Interspeech 2025 多语言对话语音语言建模挑战赛(MLC-SLM),在轨道 1(多语言语音识别任务)中获得第 4 名,在轨道 2(语音分离与识别任务)中夺得第 1 名,展示了该方法的实际可行性及强大的应用潜力。
引用
@article{arxiv.2507.08477,
title = {ILT-Iterative LoRA Training through Focus-Feedback-Fix for Multilingual Speech Recognition},
author = {Qingliang Meng and Hao Wu and Wei Liang and Wei Xu and Qing Zhao},
journal= {arXiv preprint arXiv:2507.08477},
year = {2025}
}
备注
Accepted By Interspeech 2025 MLC-SLM workshop as a Research Paper