面向机器人操作的指令驱动历史感知策略
机器人学
2022-12-20 v3 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
在人机环境中,机器人被期望根据给定的简单自然语言指令完成多种操作任务。然而,机器人操作极具挑战性,因为它需要精细的运动控制、长期记忆以及对先前未见过的任务与环境的泛化能力。为应对这些挑战,我们提出了一种统一的基于 transformer 的方法,该方法综合考虑多种输入。具体而言,我们的 transformer 架构整合了(i)自然语言指令与(ii)多视角场景观测,同时(iii)跟踪观测与动作的完整历史。这种方法能够学习历史与指令之间的依赖关系,并利用多视角提升操作精度。我们在具有挑战性的 RLBench 基准和真实机器人上评估了我们的方法。值得注意的是,我们的方法可扩展至 74 项不同的 RLBench 任务,并优于当前最优方法。我们还处理了指令条件任务,并展示出对先前未见变化的优异泛化能力。
引用
@article{arxiv.2209.04899,
title = {Instruction-driven history-aware policies for robotic manipulations},
author = {Pierre-Louis Guhur and Shizhe Chen and Ricardo Garcia and Makarand Tapaswi and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:2209.04899},
year = {2022}
}
备注
Accepted in CoRL 2022 (oral); project page at https://guhur.github.io/hiveformer/