探索多模态大型语言模型在知识密集型多模态语音识别中的潜力
计算与语言
2024-11-15 v2
摘要
近期,多模态大型语言模型 (MLLM) 在整合各种模态信息方面取得了显著进展,但在教育和科学领域的实际应用仍面临挑战。本文引入了以多模态信息增强科学会议视频转录的 MS-ASR 任务,旨在利用幻灯片的视觉信息来提高技术术语的准确率。我们意识到传统指标如 WER 在准确评估性能方面不足,因而提出了考虑内容类型和语音识别错误严重程度的严重程度感知 WER (SWER)。我们提出了科学视觉增强语音识别框架 (SciVASR),作为基线方法,使 MLLM 能够通过后编辑提高转录质量。对最先进的 MLLM 进行评估,包括 GPT-4o,显示其在语音-only 基线上的改进幅度达到 45%,凸显了多模态信息集成的重要性。
引用
@article{arxiv.2406.10880,
title = {Exploring the Potential of Multimodal LLM with Knowledge-Intensive Multimodal ASR},
author = {Minghan Wang and Yuxia Wang and Thuy-Trang Vu and Ehsan Shareghi and Gholamreza Haffari},
journal= {arXiv preprint arXiv:2406.10880},
year = {2024}
}
备注
Accepted to EMNLP 2024 Findings