面向机器人的增强现实(ARRO):指向视觉鲁棒性的视觉运动策略
机器人学
2026-01-07 v3
摘要
在人类专家演示中训练的视觉运动策略最近在广泛的机器人操作任务中显示出强大的性能。然而,这些策略对源于背景或机器人本体变化导致的领域偏移仍然高度敏感,这限制了其泛化能力。在本文中,我们提出了ARRO,这是一种新型视觉表示方法,利用零样本开词汇分割和目标检测模型高效地在不进行额外训练、模型化或相机标定的情况下实时遮蔽场景中与任务无关的区域。通过过滤视觉干扰项并在训练和推理期间叠加虚拟指南,ARRO提高了对场景变化的鲁棒性,减少了额外数据收集的需求。我们在广泛的桌面操作任务中使用扩散策略进行了广泛评估,进一步演示了其与通用机器人策略(如Octo、OpenVLA和Pi Zero)的兼容性和有效性。在我们评估中的所有设置下,ARRO都实现了一致的性能提升,允许选择性遮蔽以在不同对象之间进行选择,并且即使在具有挑战性分割条件的情况下也表现出鲁棒性。展示我们结果的视频可在:https://augmented-reality-for-robots.github.io/上访问。
引用
@article{arxiv.2505.08627,
title = {Augmented Reality for RObots (ARRO): Pointing Visuomotor Policies Towards Visual Robustness},
author = {Reihaneh Mirjalili and Tobias Jülg and Florian Walter and Wolfram Burgard},
journal= {arXiv preprint arXiv:2505.08627},
year = {2026}
}