Act3D:面向多任务机器人操作的3D特征场Transformer
机器人学
2023-10-23 v2 人工智能
机器学习
摘要
3D感知表示非常适合于机器人操作,因为它们易于编码遮挡并简化空间推理。许多操作任务在末端执行器位姿预测中需要高空间精度,这通常要求高分辨率3D特征网格,其计算开销昂贵。因此,大多数操作策略直接在2D中运行,放弃了3D归纳偏置。本文中,我们引入Act3D,一种操作策略Transformer,它使用依赖于当前任务的自适应分辨率的3D特征场来表示机器人工作空间。该模型利用感知深度将2D预训练特征提升到3D,并对其进行注意力计算以得到采样3D点的特征。它以由粗到细的方式采样3D点网格,使用相对位置注意力提取特征,并选择下一轮点采样的聚焦位置。以此方式,它高效地计算高空间分辨率的3D动作图。Act3D在已确立的操作基准RL-Bench中树立了新SOTA,在74个RLBench任务上相较先前SOTA的2D多视角策略取得10%的绝对提升,并以少3倍计算量相较先前SOTA的3D策略取得22%的绝对提升。我们在消融实验中量化了相对空间注意力、大规模视觉-语言预训练2D骨干网络以及粗到细注意力间权重绑定的重要性。代码与视频可在我们的项目网站获取:https://act3d.github.io/。
引用
@article{arxiv.2306.17817,
title = {Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation},
author = {Theophile Gervet and Zhou Xian and Nikolaos Gkanatsios and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2306.17817},
year = {2023}
}