中文

CAGE:因果注意力实现数据高效可泛化的机器人操作

机器人学 2024-12-09 v2

摘要

在将机器人扩展到具有有限演示的新环境时,机器人操作的泛化仍是一个关键挑战。本文提出了 CAGE,一种新型机器人操作策略,旨在通过集成因果注意力机制来克服这些泛化障碍。CAGE 利用视觉基础模型 DINOv2 的强大特征提取能力,结合 LoRA 微调以实现对环境的稳健理解。该策略进一步采用因果 Perceiver 进行有效的 token 压缩,并使用注意力机制的扩散基于动作预测头以增强任务特定的精细条件。即使仅使用来自单个训练环境的 50 个演示,CAGE 也能在对象、背景和视角的多样化视觉变化中实现稳健的泛化。广泛的实验表明,CAGE 在各种操作任务中显著优于现有的领先的 RGB/RGB-D 方法,尤其是在大规模分布偏移的情况下。在相似环境中,CAGE 实现了 42% 的任务完成率提升。尽管所有基线方法在不可见环境中都无法执行该任务,CAGE 仍能实现 43% 的完成率和 51% 的成功率,为在真实世界环境中部署机器人迈出了巨大的一步。项目网站:cage-policy.github.io。

关键词

引用

@article{arxiv.2410.14974,
  title  = {CAGE: Causal Attention Enables Data-Efficient Generalizable Robotic Manipulation},
  author = {Shangning Xia and Hongjie Fang and Cewu Lu and Hao-Shu Fang},
  journal= {arXiv preprint arXiv:2410.14974},
  year   = {2024}
}

备注

Submitted to ICRA 2025