中文

机器人操控中的零样本视觉泛化

机器人学 2025-05-20 v1 人工智能 机器学习

摘要

训练能够在多样化视觉环境中robust 的基于视觉的操控策略,是机器人学习中一个重要且尚未解决的挑战。当前方法常通过依赖不变表示(如点云和深度)或通过视觉域随机化和/或大规模视觉异构数据集来强行实现泛化。然而,尤其是当结合关联记忆原则时,已展现出在视觉强化学习策略中实现视觉分布迁移的潜力的解缠表示学习,近年来备受期待。然而,这些技术大多受限于较为简单的基准和玩具环境。本文将解缠表示学习和关联记忆扩展到更具视觉和动态复杂度的操控任务,展示了在仿真和真实硬件上对视觉扰动的零样本适应性。我们进一步将该方法扩展到模仿学习中,具体为 Diffusion Policy,经验性地显示相较于当前最先进的模仿学习方法,在视觉泛化方面具有显著优势。最后,我们引入了一种源自模型等变性文献的新技术,将任何已训练的神经网络策略转换为对二维平面旋转不变的策略,使我们的策略不仅在视觉上具有鲁棒性,而且对某些相机扰动具有鲁棒性。我们相信,这一工作标志着向能够即插即用且抵御真实世界部署中复杂性和动态性的操控策略迈出了重要一步。补充视频可在 https://sites.google.com/view/vis-gen-robotics/home 查看。

关键词

引用

@article{arxiv.2505.11719,
  title  = {Zero-Shot Visual Generalization in Robot Manipulation},
  author = {Sumeet Batra and Gaurav Sukhatme},
  journal= {arXiv preprint arXiv:2505.11719},
  year   = {2025}
}