中文

探索多模态大型语言模型在知识密集型多模态语音识别中的潜力

计算与语言 2024-11-15 v2

摘要

近期,多模态大型语言模型 (MLLM) 在整合各种模态信息方面取得了显著进展,但在教育和科学领域的实际应用仍面临挑战。本文引入了以多模态信息增强科学会议视频转录的 MS-ASR 任务,旨在利用幻灯片的视觉信息来提高技术术语的准确率。我们意识到传统指标如 WER 在准确评估性能方面不足,因而提出了考虑内容类型和语音识别错误严重程度的严重程度感知 WER (SWER)。我们提出了科学视觉增强语音识别框架 (SciVASR),作为基线方法,使 MLLM 能够通过后编辑提高转录质量。对最先进的 MLLM 进行评估,包括 GPT-4o,显示其在语音-only 基线上的改进幅度达到 45%,凸显了多模态信息集成的重要性。

关键词

引用

@article{arxiv.2406.10880,
  title  = {Exploring the Potential of Multimodal LLM with Knowledge-Intensive Multimodal ASR},
  author = {Minghan Wang and Yuxia Wang and Thuy-Trang Vu and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2406.10880},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 Findings