VidText:迈向视频文本理解的全面评估
计算机视觉与模式识别
2025-11-04 v2
摘要
视频中嵌入的视觉文本携带丰富的语义信息,这对于整体视频理解以及局部人类动作的细粒度推理至关重要。然而,现有的视频理解基准在很大程度上忽略了文本信息,而特定于 OCR 的基准仅限于静态图像,限制了它们捕捉文本与动态视觉上下文之间交互的能力。为了填补这一空白,我们提出了 VidText,一个旨在对视频文本理解进行全面深入评估的新基准。VidText 具有以下主要特征:1) 它涵盖了广泛的真实世界场景并支持多语言内容,包含了视频文本自然出现的多种设定。2) 它引入了具有视频级、片段级和实例级任务的分层评估框架,能够评估全局摘要和局部检索能力。3) 该基准还引入了一组配对的感知推理任务,涵盖从视觉文本感知到文本与视觉信息之间的跨模态推理。对 18 个最先进的大型多模态模型(LMM)的大量实验表明,当前模型在大多数任务上均存在困难,仍有很大的改进空间。进一步分析强调了模型内在因素(如输入分辨率和 OCR 能力)与外部因素(包括辅助信息的使用和思维链推理策略)的影响。我们希望 VidText 能填补当前视频理解基准的空白,并作为未来在动态环境中利用视频文本进行多模态推理研究的基础。
引用
@article{arxiv.2505.22810,
title = {VidText: Towards Comprehensive Evaluation for Video Text Understanding},
author = {Zhoufaran Yang and Yan Shu and Jing Wang and Zhifei Yang and Yan Zhang and Yu Li and Keyang Lu and Gangyan Zeng and Shaohui Liu and Yu Zhou and Nicu Sebe},
journal= {arXiv preprint arXiv:2505.22810},
year = {2025}
}