视觉交互网络
计算机视觉与模式识别
2017-06-06 v1
摘要
仅凭一瞥,人类便能对广泛物理系统的未来状态做出丰富的预测。另一方面,来自工程、机器人学和图形学的现代方法通常局限于狭窄的领域,并要求对底层状态进行直接测量。我们引入了视觉交互网络,这是一种从原始视觉观测中学习物理系统动力学的通用模型。我们的模型由基于卷积神经网络的感知前端和基于交互网络的动力学预测器组成。通过联合训练,感知前端学习将动态视觉场景解析为一组因子化的潜在物体表示。动力学预测器通过计算物体间的交互和动力学,学习将这些状态在时间上向前推演,从而生成任意长度的预测物理轨迹。我们发现,仅从六个输入视频帧中,视觉交互网络便能在广泛的物理系统上生成数百个时间步的精确未来轨迹。我们的模型还可应用于包含不可见物体的场景,通过其对可见物体的影响推断其未来状态,并能隐式推断物体未知的质量。我们的结果表明,感知模块和基于物体的动力学预测模块能够诱导出支持精确动力学预测的因子化潜在表示。这项工作为在复杂物理环境中基于原始感官观测的模型决策与规划开辟了新机遇。
引用
@article{arxiv.1706.01433,
title = {Visual Interaction Networks},
author = {Nicholas Watters and Andrea Tacchetti and Theophane Weber and Razvan Pascanu and Peter Battaglia and Daniel Zoran},
journal= {arXiv preprint arXiv:1706.01433},
year = {2017}
}