用于控制的视觉 3D 关键点无监督学习
机器学习
2021-06-15 v1 计算机视觉与模式识别
机器人学
摘要
从高维图像中学习传感运动控制策略关键依赖于底层视觉表征的质量。先前工作表明,诸如视觉关键点之类的结构化潜空间通常优于用于机器人控制的非结构化表征。然而,这些表征无论结构化还是非结构化大多在 2D 空间中学习,尽管控制任务通常在 3D 环境中执行。在本工作中,我们提出一种以端到端无监督方式直接从图像学习此类 3D 几何结构的框架。输入图像通过可微编码器嵌入为潜 3D 关键点,该编码器被训练以优化多视图一致性损失与下游任务目标。这些发现的 3D 关键点倾向于以跨时间与 3D 空间一致的方式有意义地捕获机器人关节以及物体运动。所提方法在多种强化学习基准上优于先前最先进方法。代码与视频见 https://buoyancy99.github.io/unsup-3d-keypoints/
引用
@article{arxiv.2106.07643,
title = {Unsupervised Learning of Visual 3D Keypoints for Control},
author = {Boyuan Chen and Pieter Abbeel and Deepak Pathak},
journal= {arXiv preprint arXiv:2106.07643},
year = {2021}
}
备注
Accepted at ICML 2021. Videos and code at https://buoyancy99.github.io/unsup-3d-keypoints/