PLEX:在机器人操作预训练中充分利用可用数据
机器人学
2023-11-10 v2 人工智能
机器学习
摘要
丰富的表征对于通用机器人操作至关重要,但现有的表征学习方法需要大量的多模态演示。在这项工作中,我们提出 PLEX,一种基于 Transformer 的架构,它从少量与任务无关的视觉运动轨迹和更大量的任务条件化物体操作视频(一种可大量获取的数据)中学习。PLEX 利用视觉运动轨迹来诱导潜在特征空间并学习任务无关的操纵例程,而多样化的仅视频演示则教导 PLEX 如何在诱导的潜在特征空间中对各种任务进行规划。实验展示了 PLEX 在 Meta-World 上的泛化能力以及在具有挑战性的 Robosuite 环境中的 SOTA 性能。特别地,在 PLEX 的 Transformer 中使用相对位置编码极大有助于从人类收集的演示中进行低数据量学习。本文的配套代码与数据可在 https://microsoft.github.io/PLEX 获取。
引用
@article{arxiv.2303.08789,
title = {PLEX: Making the Most of the Available Data for Robotic Manipulation Pretraining},
author = {Garrett Thomas and Ching-An Cheng and Ricky Loynd and Felipe Vieira Frujeri and Vibhav Vineet and Mihai Jalobeanu and Andrey Kolobov},
journal= {arXiv preprint arXiv:2303.08789},
year = {2023}
}