中文

Perceiver-Actor:一种用于机器人操作的多任务 Transformer

机器人学 2022-11-14 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

Transformer 凭借其随大规模数据集扩展的能力,已经革新了视觉和自然语言处理。但在机器人操作中,数据既有限又昂贵。在恰当的问题表述下,操作任务是否仍能从 Transformer 中获益?我们通过 PerAct 这一用于多任务 6-DoF 操作的语言条件行为克隆智能体来研究这一问题。PerAct 使用 Perceiver Transformer 对语言目标和 RGB-D 体素观测进行编码,并通过“检测下一个最佳体素动作”来输出离散化动作。与在 2D 图像上运行的框架不同,体素化的 3D 观测与动作空间为高效学习 6-DoF 动作提供了强结构先验。借助该表述,我们仅使用每个任务少量演示,便训练了一个单一的多任务 Transformer,用于 18 个 RLBench 任务(含 249 种变体)和 7 个真实世界任务(含 18 种变体)。我们的结果表明,对于广泛的桌面操作任务,PerAct 显著优于非结构化图像到动作智能体以及 3D ConvNet 基线。

关键词

引用

@article{arxiv.2209.05451,
  title  = {Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation},
  author = {Mohit Shridhar and Lucas Manuelli and Dieter Fox},
  journal= {arXiv preprint arXiv:2209.05451},
  year   = {2022}
}

备注

CoRL 2022. Project Website: https://peract.github.io/