中文

不变性协同训练用于机器人视觉泛化

机器人学 2025-12-08 v1 人工智能

摘要

从多样化观察中进行推理是通用机器人策略能够在广泛环境中操作的基本能力。尽管近期取得了进展,许多大规模机器人策略仍然对关键观测变化源敏感,例如相机视角的变化、光照变化以及干扰物体的出现。我们认为,这些模型的有限泛化能力源于稳健覆盖这些准静态轴所需的大量多样性,以及当前在跨越这些轴展现丰富变化的大规模机器人数据集的稀缺。在这项工作中,我们通过引入两个关键辅助任务——状态相似性和对观测扰动的不变性——系统地研究了机器人需要在这些具有挑战性的轴上泛化的内容,这些任务同时应用于演示数据和静态视觉数据。然后我们表明,通过这些辅助任务,利用更昂贵的机器人演示数据和更便宜的、来自非物理仿真(例如 Unreal Engine)生成的视觉丰富的合成图像,可以显著提高对未见相机视角、光照配置和干扰条件的泛化能力。我们的结果表明,在这种多样化数据上的协同训练相比现有的生成式增强方法将性能提升了 18%。更多信息与视频请访问 https://invariance-cotraining.github.io

关键词

引用

@article{arxiv.2512.05230,
  title  = {Invariance Co-training for Robot Visual Generalization},
  author = {Jonathan Yang and Chelsea Finn and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2512.05230},
  year   = {2025}
}

备注

14 pages, 10 figures