Q-attention:实现基于视觉的机器人操作的高效学习
机器人学
2022-02-07 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
尽管强化学习方法取得了成功,但其在广泛应用于各类机器人操作任务时尚未迎来突破时刻。这部分是由于强化学习算法以难以训练且耗时著称,而当从图像而非全状态输入进行训练时这一问题更加严重。人类在执行操作任务时,我们的眼睛密切监视过程的每一步,视线依次聚焦于被操作的对象。鉴于此,我们提出注意力驱动的机器人操作(ARM)算法,这是一种通用的操作算法,仅需少量演示即可应用于一系列稀疏奖励任务。ARM 将复杂的操作任务拆分为一个三阶段流水线:(1)一个 Q-attention 智能体从 RGB 和点云输入中提取相关像素位置,(2)一个接受 Q-attention 智能体裁剪并输出位姿的下一最佳位姿智能体,以及(3)一个接收目标位姿并输出关节动作的 control 智能体。我们表明当前的 learning 算法在一系列 RLBench 任务上失败,而 ARM 是成功的。
引用
@article{arxiv.2105.14829,
title = {Q-attention: Enabling Efficient Learning for Vision-based Robotic Manipulation},
author = {Stephen James and Andrew J. Davison},
journal= {arXiv preprint arXiv:2105.14829},
year = {2022}
}
备注
IEEE Robotics and Automation Letters, 2022 (+ presentation at ICRA 2022). Videos and code found at: https://sites.google.com/view/q-attention