中文

跨越鸿沟:语音-LLM 与端到端架构在多语言对话语音识别中的比较探索

计算与语言 2026-02-03 v3 声音 音频与语音处理

摘要

INTERSPEECH 2025挑战赛聚焦于多语言对话语音语言模型(MLC-SLM),推动多语言对话语音识别(ASR)与大语言模型(LLM)的结合。我们之前的SHNU-mASR系统采用竞争性平行语音编码器架构,将Whisper和mHuBERT与LLM集成。然而,该系统面临两个挑战:简单的特征拼接可能未充分利用互补信息,以及LLM-based ASR与端到端(E2E)编码器-解码器ASR之间的性能差距尚未探讨。本文提出增强型LLM-based ASR框架,将经过微调的Whisper和mHuBERT编码器与LLM结合,以丰富语音表征。我们首先评估在MLC-SLM ASR任务上使用LoRA和全参数微调的E2E Whisper模型,然后提出基于跨注意力的融合机制用于平行语音编码器。在MLC-SLM挑战赛官方评估集上,我们的系统实现了10.69%的错误率(CER/WER),与前列Track 1系统持平,尽管仅使用了1,500小时的基线训练数据,而其他系统使用的是大规模训练集。尽管如此,我们发现最终的LLM-based ASR仍不如经微调的E2E Whisper模型。我们的工作为未来的Speech-LLM设计提供了宝贵的经验性指导。我们的代码已公开于https://github.com/1535176727/MLC-SLM。

关键词

引用

@article{arxiv.2601.01461,
  title  = {Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR},
  author = {Yuxiang Mei and Dongxing Xu and Jiaen Liang and Yanhua Long},
  journal= {arXiv preprint arXiv:2601.01461},
  year   = {2026}
}

备注

Accepted by ICASSP2026