你能将其拼接起来吗?面向视觉推理的Human Curated基准测试
计算机视觉与模式识别
2025-09-30 v1 人工智能
摘要
本文介绍了SPLICE,这是一个来自COIN指令性视频数据集的、经过人类精选构建的基准测试,旨在探测跨多个维度(时间、因果、空间、情境和常识)的事件推理能力。SPLICE包含3,381个人类筛选后的视频,涵盖12个类别和180个子类别,如体育、工程和家务。这些视频被分割为11,423个事件片段。我们评估了人类参与者和最新视觉语言模型(VLMs)在将这些片段重新排列成连贯事件序列中的能力,以评估视觉推理。结果显示存在显著差距:VLMs难以达到人类水平。虽然人工标注的文本描述可提高模型准确率,但对人类表现没有影响,表明模型更依赖语言先验而非视觉理解。即使有标注,VLMs仍未达到人类水平的推理,凸显了视觉推理中持久的挑战。深入分析显示,VLMs在时间和因果推理占主导的视频上表现相对较好,优于情境和空间推理占主导的视频;在日常任务上也优于专业任务。
引用
@article{arxiv.2509.24640,
title = {Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs},
author = {Mohamad Ballout and Okajevo Wilfred and Seyedalireza Yaghoubi and Nohayr Muhammad Abdelmoneim and Julius Mayer and Elia Bruni},
journal= {arXiv preprint arXiv:2509.24640},
year = {2025}
}