BARISTA:面向组合化视觉理解的多任务体格基准
计算机视觉与模式识别
2026-05-13 v1
摘要
场景理解是通用物理智能的核心内容,视频是捕捉场景状态和时间动态的主要模态。然而,理解物理过程仍然困难,因为模型必须结合对象定位、手-对象交互、关系解析、时间推理和步骤级程序推断。现有的基准通常在这些能力上分别进行评估,限制了对程序任务中模型失败原因的诊断。我们引入 BARISTA—a 个密集标注的体格数据集和基准,覆盖 185 个真实世界的咖啡制作视频,涵盖完全自动、法式滤压和胶囊式工作流程。BARISTA 提供了经过验证的 per-frame 场景图,将持久对象身份与 mask、track、box、属性、typed 关系、手-对象交互、活动和过程步骤关联。从这些图中,我们派生出从 phrase grounding、手-对象交互识别、指代、活动识别、关系提取到时间视觉问答等的 zero-shot language-based 任务。实验揭示了 task family 之间的显著差异,没有一致占主导地位的模型家族,使 BARISTA 成为程序视频理解的具有挑战性的诊断基准。代码和数据集可在 https://huggingface.co/datasets/ramblr/BARISTA 获取。
引用
@article{arxiv.2605.12074,
title = {BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding},
author = {Patrick Knab and Orgest Xhelili and Inis Buzi and Drago Andres Guggiana Nilo and Mohd Saquib Khan and Lorenz Kolb and Manuel Scherzer and Kerem Yildirir and Christian Bartelt and Philipp Johannes Schubert},
journal= {arXiv preprint arXiv:2605.12074},
year = {2026}
}