通过动态视觉推理 grounding 物体与事件的物理概念
计算机视觉与模式识别
2021-03-31 v1 人工智能
计算与语言
机器学习
符号计算
摘要
我们研究原始视频上的动态视觉推理问题。这是一个具有挑战性的问题;当前最先进模型往往需要对来自仿真的物理物体属性与事件进行密集监督,而这在真实场景中难以获取。本文提出动态概念学习器(DCL),一种从视频与语言中 grounding 物理物体与事件的统一框架。DCL 首先采用轨迹提取器随时间跟踪每个物体,并将其表示为潜在的、以物体为中心的特征向量。基于该以物体为中心的表示,DCL 学习使用图网络近似物体间的动态交互。DCL 进一步整合语义解析器将问题解析为语义程序,并最终由程序执行器利用所学动力学模型运行程序以回答问题。训练后,DCL 可跨帧检测与关联物体、grounding 视觉属性与物理事件、理解事件间因果关系、进行未来与反事实预测,并利用这些提取的表示回答查询。DCL 在具挑战性的因果视频推理数据集 CLEVRER 上取得了最先进性能,即便训练时未使用来自仿真的真值属性与碰撞标签。我们进一步在源自 CLEVRER 的新提出的视频检索与事件定位数据集上测试 DCL,展示了其强大的泛化能力。
引用
@article{arxiv.2103.16564,
title = {Grounding Physical Concepts of Objects and Events Through Dynamic Visual Reasoning},
author = {Zhenfang Chen and Jiayuan Mao and Jiajun Wu and Kwan-Yee Kenneth Wong and Joshua B. Tenenbaum and Chuang Gan},
journal= {arXiv preprint arXiv:2103.16564},
year = {2021}
}
备注
ICLR 2021. Project page: http://dcl.csail.mit.edu/