MLC-SLM 2025 挑战中 TEA-ASLP 系统:多语言对话语音识别与说话人分割
声音
2025-07-25 v1 音频与语音处理
摘要
本文介绍了提交给 MLC-SLM 2025 挑战的 TEA-ASLP 系统,旨在解决任务 I 中的多语言对话式自动语音识别 (ASR) 和任务 II 中的语音分割 ASR。任务 I 中,我们通过整合已知语言识别和多语言 MOE LoRA 结构,以及使用 CTC 预测标记作为提示来增强 Ideal-LLM 模型。该模型在约18万小时的多语言 ASR 数据上进行训练。在任务 II 中,我们将基线的英中双语说话人分割模型替换为更适合的英语单语版本。我们的方法较基线语音语言模型实现了 30.8% 的词错误率 (WER) 降低,最终在任务 I 中达到 9.60% 的 WER,在任务 II 中达到 17.49% 的时间受限最小置换 WER,分别在相应挑战任务中获得第一和第二名成绩。
引用
@article{arxiv.2507.18051,
title = {The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge},
author = {Hongfei Xue and Kaixun Huang and Zhikai Zhou and Shen Huang and Shidong Shang},
journal= {arXiv preprint arXiv:2507.18051},
year = {2025}
}
备注
Interspeech 2025 workshop