STAR: 现实世界视频中 Situated 推理基准
人工智能
2024-05-17 v1 计算与语言
计算机视觉与模式识别
摘要
现实世界的推理离不开情境。如何从周围的情境中捕获当前知识并据此进行推理,是机器智能面临的关键且具挑战性的问题。本文介绍了一个新基准,用于评估通过情境抽象和基于逻辑的问答来评估现实世界视频中的 Situated 推理能力,称为 Situated Reasoning in Real-World Videos(STAR 基准)。该基准建立在与人类行为或相互作用相关的现实世界视频之上,这些视频本质上是动态的、组合性的和逻辑的。数据集包括四类问题,包括互动、序列、预测和可行性问题。我们通过将可观察到的原子实体和关系(例如动作、人员、对象和关系)连接起来的超图来表示现实世界视频中的情境。除了视觉感知之外,Situated 推理还需要结构化的情境理解和逻辑推理。问题和答案是程序化生成的。每个问题的解答逻辑基于情境超图表示为函数程序。我们比较了各种现有的视频推理模型,发现它们在这一挑战性的 Situated 推理任务上都难以胜任。我们进一步提出了一种诊断神经符号模型,可在视觉感知、情境抽象、语言理解和函数推理之间进行区分,以理解本基准的挑战。
引用
@article{arxiv.2405.09711,
title = {STAR: A Benchmark for Situated Reasoning in Real-World Videos},
author = {Bo Wu and Shoubin Yu and Zhenfang Chen and Joshua B Tenenbaum and Chuang Gan},
journal= {arXiv preprint arXiv:2405.09711},
year = {2024}
}
备注
NeurIPS