Seewo对MLC-SLM的提交:语音推理语言模型的经验总结
计算与语言
2025-06-19 v3 人工智能
声音
音频与语音处理
摘要
本文展示了Seewo在多语言对话语音语言模型挑战赛(MLC-SLM)两个赛道中的系统,分别针对自动语音识别(ASR)以及结合说话人日志的自动语音识别(SD-ASR)。我们提出了一种多阶段训练流水线,明确增强语音语言模型中的推理与自我纠错能力。该方法结合了课程学习以实现渐进式能力获取、思维链数据增强以促进中间反思,以及可验证奖励强化学习(RLVR)以通过奖励驱动优化进一步细化自我纠错。该方法在官方挑战基线之上取得了显著提升。在评估集上,我们的最佳系统在Track 1上达到11.57%的WER/CER,在Track 2上达到17.67%的tcpWER/tcpCER。全面的消融实验验证了各组件在挑战约束下的有效性。
引用
@article{arxiv.2506.13300,
title = {Seewo's Submission to MLC-SLM: Lessons learned from Speech Reasoning Language Models},
author = {Bo Li and Chengben Xu and Wufeng Zhang},
journal= {arXiv preprint arXiv:2506.13300},
year = {2025}
}