中文

利用区域提议交互网络学习长期视觉动力学

计算机视觉与模式识别 2021-04-06 v5 机器学习 图像与视频处理

摘要

学习长期动力学模型是理解物理常识的关键。现有多数从视觉输入学习动力学的方法通过借助短期模型进行快速重规划来回避长期预测。这不仅要求此类模型极其准确,还将它们限制于智能体能够持续获得反馈并在每一步采取动作直至完成的任务。本文中,我们旨在利用视觉识别任务中成功案例的思想,构建能够捕捉长程上物体间及物体-环境交互的物体表示。为此,我们提出区域提议交互网络(RPIN),其在潜在区域提议特征空间中推理每个物体的轨迹。得益于简单而有效的物体表示,我们的方法在预测质量及为下游任务做规划的能力上均大幅优于先前方法,并且能很好地泛化到新环境。代码、预训练模型和更多可视化结果见 https://haozhi.io/RPIN。

关键词

引用

@article{arxiv.2008.02265,
  title  = {Learning Long-term Visual Dynamics with Region Proposal Interaction Networks},
  author = {Haozhi Qi and Xiaolong Wang and Deepak Pathak and Yi Ma and Jitendra Malik},
  journal= {arXiv preprint arXiv:2008.02265},
  year   = {2021}
}

备注

ICLR 2021; Code: https://github.com/HaozhiQi/RPIN Website: https://haozhiqi.github.io/RPIN/ v5: update PHYRE results of each evaluation fold