拆解视频LLM基准测试:知识、空间感知,还是真正的时间理解?
计算机视觉与模式识别
2025-05-21 v1
摘要
现有的视频理解基准测试常常将基于知识的问题与纯粹基于图像的问题混为一谈,未能清晰地隔离模型时间推理能力,这正是区别于其他模态的关键方面。我们识别出两个主要局限性,掩盖了更高分数是否真正反映了对视频动态内容理解的强度:(1)强语言先验,模型可以在不观看视频的情况下回答问题;(2)随机性不变性,模型即使在视频帧顺序被随机打乱的情况下,仍能在某些问题上保持类似性能。为缓解这些问题,我们提出VBenchComp(Video Benchmark Competition)框架,将问题分为不同领域:LLM-Answerable、Semantic和Temporal。具体而言,LLM-Answerable问题无需观看视频即可回答;Semantic问题即使视频帧被随机排序仍可回答;Temporal问题需要理解帧顺序的正确性。其余问题标记为Others。这可以实现对视频LLM不同能力的细粒度评估。我们的分析揭示了传统总体得分掩盖的模型细微弱点,并为设计更准确评估视频LLM的未来基准提供了见解和建议。
引用
@article{arxiv.2505.14321,
title = {Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?},
author = {Bo Feng and Zhengfeng Lai and Shiyu Li and Zizhen Wang and Simon Wang and Ping Huang and Meng Cao},
journal= {arXiv preprint arXiv:2505.14321},
year = {2025}
}