中文

MME-VideoOCR:评估多模态 LLM 在视频场景中的 OCR 能力

计算机视觉与模式识别 2025-09-26 v2

摘要

多模态大语言模型(MLLM)在静态图像的光学字符识别(OCR)中已取得相当高的准确率。然而,由于运动模糊、时间变化以及视频内容固有的视觉效果等因素,其在视频 OCR 中的效能显著下降。为了为训练实用的 MLLM 提供更清晰的指导,我们引入了 MME-VideoOCR 基准,该基准涵盖了全面的视频 OCR 应用场景。MME-VideoOCR 包含 10 个任务类别,涵盖 25 个独立任务,并跨越 44 种不同场景。这些任务不仅限于文本识别,还融入了对视频中文本内容的深层理解与推理。该基准由 1,464 个具有不同分辨率、宽高比和时长的视频,以及 2,000 个精心筛选、人工标注的问答对组成。我们在 MME-VideoOCR 上评估了 18 个 SOTA MLLM,结果显示即使是表现最好的模型(Gemini-2.5 Pro)也仅达到 73.7% 的准确率。细粒度分析表明,尽管现有 MLLM 在相关文本包含在单帧或少数帧内的任务中表现出色,但它们在有效处理需要整体视频理解的任务时能力有限。这些局限性在需要时空推理、跨帧信息整合或抵抗语言先验偏差的场景中尤为明显。我们的发现还强调了高分辨率视觉输入和充足时间覆盖对于动态视频场景中进行可靠 OCR 的重要性。

关键词

引用

@article{arxiv.2505.21333,
  title  = {MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios},
  author = {Yang Shi and Huanqian Wang and Wulin Xie and Huanyao Zhang and Lijie Zhao and Yi-Fan Zhang and Xinfeng Li and Chaoyou Fu and Zhuoer Wen and Wenting Liu and Zhuoran Zhang and Xinlong Chen and Bohan Zeng and Sihan Yang and Yushuo Guan and Zhang Zhang and Liang Wang and Haoxuan Li and Zhouchen Lin and Yuanxing Zhang and Pengfei Wan and Haotian Wang and Wenjing Yang},
  journal= {arXiv preprint arXiv:2505.21333},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025