CLEVRER:面向视频表示与推理的碰撞事件数据集
计算机视觉与模式识别
2020-03-10 v2 人工智能
计算与语言
机器学习
摘要
从视频中推理时间和因果事件的能力是人类智能的核心。然而,大多数视频推理基准侧重于从复杂的视觉和语言输入中进行模式识别,而非因果结构。我们研究了一个互补的问题,探索具有简单视觉外观的物体视频背后的时间和因果结构。为此,我们引入了面向视频表示与推理的碰撞事件(CoLlision Events for Video REpresentation and Reasoning,CLEVRER),这是一个用于系统评估计算模型在广泛推理任务上表现的诊断性视频数据集。受人类因果判断理论的启发,CLEVRER包含四类问题:描述性(如“什么颜色”)、解释性(“什么是原因”)、预测性(“接下来会发生什么”)和反事实性(“如果……会怎样”)。我们在该基准上评估了多种最先进的视觉推理模型。虽然这些模型在基于感知的任务(描述性)上表现出色,但在因果任务(解释性、预测性和反事实性)上表现不佳,这表明因果推理的原则性方法应同时具备感知复杂视觉和语言输入以及理解底层动态和因果关系的能力。我们还研究了一个通过符号表示显式组合这些组件的预言机模型。
引用
@article{arxiv.1910.01442,
title = {CLEVRER: CoLlision Events for Video REpresentation and Reasoning},
author = {Kexin Yi and Chuang Gan and Yunzhu Li and Pushmeet Kohli and Jiajun Wu and Antonio Torralba and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:1910.01442},
year = {2020}
}
备注
The first two authors contributed equally to this work. Accepted as Oral Spotlight as ICLR 2020. Project page: http://clevrer.csail.mit.edu/