中文

“如果……会怎样”——学习预测图像中力的作用效果

计算机视觉与模式识别 2016-03-18 v1

摘要

如果推动桌上杯子向桌边移动会怎样?推桌子抵墙又如何?本文研究理解物体因施加外力而产生的运动的问题。对于图像中特定位置施加的给定力向量,我们的目标是预测该力引起的长期顺序运动。这需要对场景几何、物体、其属性以及支配物体运动的物理规则进行推理。我们设计了一个深度神经网络模型,通过结合卷积神经网络与循环神经网络来考虑场景几何与外观,同时学习物体运动的长期顺序依赖。训练我们的模型需要大规模外力引起物体运动的数据集。为构建场景中的力数据集,我们在物理模拟器中重建了 SUN RGB-D 数据集中的所有图像,以估计施加外力引起的物体物理运动。我们的 Forces in Scenes (ForScene) 数据集包含 10,335 张图像,其中对不同类型物体施加了各种外力,产生了超过 65,000 个以 3D 表示的物体运动。我们的实验评估表明,从单幅图像预测物体作为对外力反应的长期运动这一挑战性任务是可能的。

关键词

引用

@article{arxiv.1603.05600,
  title  = {"What happens if..." Learning to Predict the Effect of Forces in Images},
  author = {Roozbeh Mottaghi and Mohammad Rastegari and Abhinav Gupta and Ali Farhadi},
  journal= {arXiv preprint arXiv:1603.05600},
  year   = {2016}
}