多物体场景中使用物体感知表征的视觉运动控制
机器人学
2023-03-14 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
对场景及其不同组件之间关系的感知理解对于成功完成机器人任务十分重要。表征学习已被证明是一种强大的技术,但当前大多数方法学习的是特定于任务的表征,未必能很好地迁移到其他任务。此外,由监督方法学习的表征需要每个任务的大量标注数据集,而在现实世界中收集这些数据集成本高昂。使用自监督学习从未标注数据中获取表征可缓解此问题。然而,当前的自监督表征学习方法大多对物体无感知,我们证明由此得到的表征不足以用于通用机器人任务,因为它们未能捕捉含多组件场景的复杂性。本文中,我们探索了将物体感知表征学习技术用于机器人任务的有效性。我们的自监督表征通过观察智能体自由地与环境的各个部分交互来学习,并在两种不同设定下进行查询:(i)策略学习以及(ii)物体位置预测。我们表明,我们的模型以样本高效的方式学习控制策略,并且优于最先进的物体无感知技术以及基于原始 RGB 图像训练的方法。我们的结果显示,在使用隐式行为克隆(IBC)的策略训练中,低数据 regime(1000 条轨迹)下性能提升 20%。此外,我们的方法在多物体场景的物体定位任务中优于基线。
引用
@article{arxiv.2205.06333,
title = {Visuomotor Control in Multi-Object Scenes Using Object-Aware Representations},
author = {Negin Heravi and Ayzaan Wahid and Corey Lynch and Pete Florence and Travis Armstrong and Jonathan Tompson and Pierre Sermanet and Jeannette Bohg and Debidatta Dwibedi},
journal= {arXiv preprint arXiv:2205.06333},
year = {2023}
}