VELOCITI:基于严格蕴含的视频语言组成推理基准
计算机视觉与模式识别
2025-04-01 v2 人工智能
机器学习
摘要
视频中组成推理的基本方面是将人员及其跨时间的动作关联起来。近年来,针对通用视觉或视频模型的进展以及对长视频理解的推进,使该领域取得了很大的进展。尽管如此,我们仍回头思考:当前模型在短视频上的组成推理表现如何?为此,我们引入 VELOCITI,一个用于研究 Video-LLMs 的基准,通过解耦和评估 agents、actions 以及它们在多个事件中的关联来评估理解。我们采用视频语言蕴含设置,提出 StrictVLE 要求对正负标题进行正确分类(而非排序)。我们评估了几个模型,发现即使是表现最好的 LLaVA-OneVision (44.5%) 和 Gemini-1.5-Pro (49.3%),与人类准确率93.0%相距甚远。结果表明,动作理解在 agents 方面滞后,负面标题使用视频中出现的实体创建的表现差于纯文本操纵创建的标题。我们也展示了 ClassicVLE 和多选 (MC) 评估的挑战,加强了我们对 StrictVLE 的偏好。最后,我们验证了该基准需要多个帧的视觉输入,这使其成为研究视频语言组成推理的理想选择。
引用
@article{arxiv.2406.10889,
title = {VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment},
author = {Darshana Saravanan and Varun Gupta and Darshan Singh and Zeeshan Khan and Vineet Gandhi and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2406.10889},
year = {2025}
}
备注
Accepted to CVPR 2025. Project Page, see https://katha-ai.github.io/projects/velociti