Index-MSR:一种用于语音识别的高效多模态融合框架
音频与语音处理
2025-09-30 v1 人工智能
多媒体
声音
摘要
在大规模数据集和基于大语言模型(LLM)架构的驱动下,自动语音识别(ASR)系统在准确率方面取得了显著提升。然而,对于领域特定术语和缺乏语义连贯性的短语音,识别性能往往会显著下降,挑战依然存在。在这项工作中,我们提出了 Index-MSR,一种高效的多模态语音识别框架。其核心是一个新颖的多模态融合解码器(MFD),它能有效地将视频中的文本相关信息(例如,字幕和演示幻灯片)融入语音识别中。这种跨模态集成不仅提高了整体 ASR 准确率,还显著减少了替换错误。在内部字幕数据集和公开 AVSR 数据集上的广泛评估表明,Index-MSR 达到了最先进的准确率,替换错误减少了 20% 至 50%。这些结果表明,我们的方法能有效利用视频中的文本相关线索来提高语音识别准确率,在需要严格音文同步的应用(如音频翻译)中展现出强大的潜力。
引用
@article{arxiv.2509.22744,
title = {Index-MSR: A high-efficiency multimodal fusion framework for speech recognition},
author = {Jinming Chen and Lu Wang and Zheshu Song and Wei Deng},
journal= {arXiv preprint arXiv:2509.22744},
year = {2025}
}
备注
Submit to icassp 2026