中文

无标注的以对象为中心的视频预测

计算机视觉与模式识别 2021-05-07 v1 机器人学

摘要

为了与世界交互,智能体必须能够预测世界动力学的结果。学习这些动力学的一个自然方法是通过视频预测,因为相机是普遍且强大的传感器。直接的像素到像素视频预测是困难的,未利用已知先验,且未提供利用所学动力学的简便接口。以对象为中心的视频预测通过利用世界由对象构成的简单先验并提供更自然的控制接口,为这些问题提供了解决方案。然而,现有的以对象为中心的视频预测流程需要在训练视频序列中进行密集对象标注。在本工作中,我们提出无标注的以对象为中心预测(OPA),一种利用强大计算机视觉模型先验的以对象为中心视频预测方法。我们在由堆叠物体下落的视频序列组成的数据集上验证了我们的方法,并展示了如何通过端到端视频预测训练在环境中适配感知模型。

关键词

引用

@article{arxiv.2105.02799,
  title  = {Object-centric Video Prediction without Annotation},
  author = {Karl Schmeckpeper and Georgios Georgakis and Kostas Daniilidis},
  journal= {arXiv preprint arXiv:2105.02799},
  year   = {2021}
}