3D-IntPhys:面向复杂场景下更具泛化性的三维接地视觉直觉物理
计算机视觉与模式识别
2023-04-25 v1 人工智能
摘要
给定视觉场景,人类对于在给定动作下场景如何随时间演化具有强烈的直觉。这种直觉常被称为视觉直觉物理,是一种关键能力,使我们能够制定有效计划来操控场景以达成期望结果,而无需依赖大量试错。本文提出一个能够从包含流体的复杂场景视频中学习三维接地视觉直觉物理模型的框架。我们的方法由一个条件式神经辐射场(NeRF)风格视觉前端和一个基于三维点的动力学预测后端组成,借此我们可以施加强关系与结构归纳偏置以捕捉底层环境的结构。不同于现有依赖模拟器密集点轨迹监督的直觉式基于点的动力学工作,我们放宽了要求,仅假设可获取多视角 RGB 图像以及利用颜色先验获得的不完美实例掩码。这使得所提模型能够处理难以或无法进行准确点估计与跟踪的场景。我们在模拟中生成了包含涉及流体、颗粒材料和刚体三种复杂场景的数据集。这些数据集不包含任何密集粒子信息,因此多数以往的基于三维的直觉物理流程几乎无法处理。我们展示了我们的模型能够通过从原始图像学习做出长时域未来预测,并显著优于未采用显式三维表示空间的模型。我们还展示了模型一经训练,便能在外推设定下的复杂场景中实现强泛化。
引用
@article{arxiv.2304.11470,
title = {3D-IntPhys: Towards More Generalized 3D-grounded Visual Intuitive Physics under Challenging Scenes},
author = {Haotian Xue and Antonio Torralba and Joshua B. Tenenbaum and Daniel LK Yamins and Yunzhu Li and Hsiao-Yu Tung},
journal= {arXiv preprint arXiv:2304.11470},
year = {2023}
}