从视频与语言学习可微物理模型进行动态视觉推理
计算机视觉与模式识别
2021-10-29 v1 人工智能
机器学习
摘要
在这项工作中,我们提出一个称为可微物理视觉推理(VRDP)的统一框架,它能够从视频和语言中联合学习视觉概念并推断物体及其相互作用的物理模型。这是通过无缝集成三个组件实现的:视觉感知模块、概念学习器和可微物理引擎。视觉感知模块将每帧视频解析为以物体为中心的运动轨迹,并将其表示为潜在场景表示。概念学习器基于语言从这些以物体为中心的表示中 grounding(接地)视觉概念(如颜色、形状和材料),从而为物理引擎提供先验知识。可微物理模型实现为一个基于冲量的可微刚体模拟器,基于 grounded 概念执行可微物理模拟,通过将模拟轨迹拟合到视频观测来推断质量、恢复系数和速度等物理属性。因此,这些学到的概念和物理模型可以解释我们所见,并想象未来和反事实场景中将发生什么。将可微物理集成到动态推理框架中带来了若干吸引人的好处。在学到的物理模型中更精确的动力学预测在合成与真实世界基准上都达到了最先进性能,同时仍保持高透明度和可解释性;最显著的是,与最佳同类方法相比,VRDP 将预测和反事实问题的准确率分别提高了 4.5% 和 11.5%。VRDP 还具有高数据效率:物理参数可从极少视频中优化,甚至单个视频就足够。最后,在推断所有物理参数后,VRDP 能从少量示例中快速学习新概念。
引用
@article{arxiv.2110.15358,
title = {Dynamic Visual Reasoning by Learning Differentiable Physics Models from Video and Language},
author = {Mingyu Ding and Zhenfang Chen and Tao Du and Ping Luo and Joshua B. Tenenbaum and Chuang Gan},
journal= {arXiv preprint arXiv:2110.15358},
year = {2021}
}
备注
NeurIPS 2021. Project page: http://vrdp.csail.mit.edu/