MLC-SLM挑战任务1的Eloquence团队提交
声音
2025-07-28 v1 计算与语言
音频与语音处理
摘要
本文呈现我们为挑战与研讨会上的MLC-SLM(Challenge and Workshop on Multilingual Conversational Speech Language Model)任务1所进行的研究与实验。该任务聚焦于通过开发语音语言模型架构来推进多语言对话式语音识别。鉴于实用对话数据对于构建稳健的 spoken dialogue system的日益重要,我们探索了三种多语言ASR方法。首先,我们对官方基线进行评估,以更好地理解其优势与局限性,通过训练两个投影器(线性和qformer)以不同的基础模型。其次,我们利用SLAM-ASR框架训练一个定制的多语言线性投影器。最后我们探讨了对比学习和扩展对话上下文在增强识别鲁棒性中的作用。
引用
@article{arxiv.2507.19308,
title = {The Eloquence team submission for task 1 of MLC-SLM challenge},
author = {Lorenzo Concina and Jordi Luque and Alessio Brutti and Marco Matassoni and Yuchen Zhang},
journal= {arXiv preprint arXiv:2507.19308},
year = {2025}
}
备注
Technical Report for MLC-SLM Challenge of Interspeech2025