中文

面向机器人操作的 3D 动态场景表示学习

机器人学 2020-12-11 v2 计算机视觉与模式识别

摘要

面向机器人操作的 3D 场景表示应捕获三个关键物体属性:恒存性——随时间被遮挡的物体继续存在;非模态完备性——物体具有 3D 占位,即便仅有部分观测可用;时空连续性——每个物体的运动在时空上连续。本文引入 3D 动态场景表示(DSR),一种 3D 体素场景表示,在捕获全部三种属性的同时发现、跟踪、重建物体并预测其动态。我们进一步提出 DSR-Net,其学习在多次交互中聚合视觉观测以逐步构建并精炼 DSR。我们的模型在模拟与真实数据上以 DSR 建模 3D 场景动态方面均达到最先进性能。结合模型预测控制,DSR-Net 能够在平面推动等下游机器人操作任务中实现准确规划。视频见 https://youtu.be/GQjYG3nQJ80。

关键词

引用

@article{arxiv.2011.01968,
  title  = {Learning 3D Dynamic Scene Representations for Robot Manipulation},
  author = {Zhenjia Xu and Zhanpeng He and Jiajun Wu and Shuran Song},
  journal= {arXiv preprint arXiv:2011.01968},
  year   = {2020}
}

备注

CoRL 2020. The first two authors contributed equally to this paper. Project page: https://dsr-net.cs.columbia.edu/