VideoCogQA:用于评估视频语言模型认知能力的可控基准
计算机视觉与模式识别
2025-07-02 v2 人工智能
摘要
大型视频语言模型 (LVLMs) 的最新进展在多模态视频理解方面取得了令人振奋的成果,但是否具备执行高级任务所需的认知能力尚不明确,尤其是涉及符号和抽象感知的任务。现有基准通常依赖真实世界的注释视频,缺乏对视频内容和内在难度的控制,限制了其诊断效能。为弥合这一差距,我们提出 VideoCogQA,一个受游戏世界环境启发、旨在评估 LVLMs 认知能力的可扩展且全可控基准。通过程序化引擎生成合成视频,VideoCogQA 允许对视觉元素、时间动态和任务难度进行细粒度控制。这种方法实现了独立于视觉场景语义先验知识的视频认知能力评估。数据集包含 800 个视频和 3,280 个问答对,涵盖抽象概念、符号元素和多模态集成任务,难度等级各异。实验结果显示,即便是最先进 (SOTA) 模型如 GPT-4o,在涉及抽象概念的任务上平均得分为 48.8%。此外,随着任务复杂度提升,性能下降约 15%,凸显了 LVLMs 在保持一致性能方面的挑战。通过本工作,我们希望揭示当前 LVLMs 的局限性,并为其更有效地模拟人类认知过程提供启示。
引用
@article{arxiv.2411.09105,
title = {VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models},
author = {Chenglin Li and Qianglong Chen and Zhi Li and Feng Tao and Yin Zhang},
journal= {arXiv preprint arXiv:2411.09105},
year = {2025}
}