用于视觉运动控制的3D神经场景表示
机器人学
2021-11-15 v2 计算机视觉与模式识别
机器学习
摘要
人类对周围的3D环境有着强烈的直觉理解。我们大脑中对物理的心智模型适用于不同材质的物体,并使我们能够执行远超当前机器人能力范围的广泛操作任务。在本工作中,我们希望仅从2D视觉观测中学习动态3D场景的模型。我们的模型将神经辐射场(NeRF)和时间对比学习与自编码框架相结合,学习视角不变的3D感知场景表示。我们展示了在所学表示空间上构建的动力学模型能够实现涉及刚体与流体的困难操作任务的视觉运动控制,其中目标以与机器人操作视角不同的视角指定。当与自解码框架结合时,它甚至能支持来自训练分布之外相机视角的目标指定。我们通过对未来预测和新视角合成进一步展示了所学3D动力学模型的丰富性。最后,我们针对不同的系统设计提供了详细的消融研究以及对所学表示的定性分析。
引用
@article{arxiv.2107.04004,
title = {3D Neural Scene Representations for Visuomotor Control},
author = {Yunzhu Li and Shuang Li and Vincent Sitzmann and Pulkit Agrawal and Antonio Torralba},
journal= {arXiv preprint arXiv:2107.04004},
year = {2021}
}
备注
Accepted to Conference on Robot Learning (CoRL 2021) as Oral Presentation. The first two authors contributed equally. Project Page: https://3d-representation-learning.github.io/nerf-dy/