抗遮挡的从视频中学习直觉物理
计算机视觉与模式识别
2020-05-04 v1 机器学习
图像与视频处理
摘要
为在复杂任务上达到人类水平,人工系统的关键能力是理解物体间的物理交互并预测情境的未来结果。这一能力常被称为直觉物理,近来受到关注,已有若干方法被提出以从视频序列中学习这些物理规则。然而,多数方法局限于无遮挡或仅有限遮挡的情形。在本工作中,我们提出了在具有显著物体间遮挡的 3D 场景中学习直觉物理的概率公式。在我们的公式中,物体位置被建模为潜变量,从而实现场景重建。我们随后提出一系列近似使该问题可解。物体提议通过循环交互网络(在物体空间建模物理)与组合式渲染器(建模物体投影到像素空间的方式)的结合跨帧关联。我们在 IntPhys 直觉物理基准上展示了相较最先进方法的显著改进。我们将方法应用于第二个具有递增遮挡水平的数据集,显示其可真实预测未来至多 30 帧的分割掩码。最后,我们也展示了在真实视频中预测物体运动的结果。
引用
@article{arxiv.2005.00069,
title = {Occlusion resistant learning of intuitive physics from videos},
author = {Ronan Riochet and Josef Sivic and Ivan Laptev and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2005.00069},
year = {2020}
}