当前视频大语言模型的 OCR 能力如何?——初步探索
计算机视觉与模式识别
2024-12-31 v1
摘要
随着多模态大语言模型的兴起, 从视频内容中准确提取并理解文本信息(称为视频基于光学字符识别,Video OCR)已成为关键能力。本文引入了一套新颖的基准测试,旨在评估多模态模型在视频中的 OCR 性能。该基准包含 1,028 个视频和 2,961 对问答对,通过 6 个不同子任务提出several关键挑战:(1)文本内容及其基本视觉属性的识别,(2)OCR 对象的语义与空间理解,(3)动态运动检测与时序定位。我们采用半自动化方法构建了该基准,将图像类大语言模型的 OCR 能力与人工细化相结合,实现了效率、成本与数据质量之间的平衡。该资源旨在推动视频大语言模型的研究,并凸显了提升视频大语言模型 OCR 能力的必要性。该基准将发布在 https://github.com/YuHuiGao/FG-Bench.git 上。
引用
@article{arxiv.2412.20613,
title = {Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study},
author = {Yulin Fei and Yuhui Gao and Xingyuan Xian and Xiaojin Zhang and Tao Wu and Wei Chen},
journal= {arXiv preprint arXiv:2412.20613},
year = {2024}
}
备注
Accepted by CoLing 2025 (The 31st International Conference on Computational Linguistics)