中文

Sim2real图像转换使基于固定相机数据集的视点鲁棒策略成为可能

计算机视觉与模式识别 2026-02-16 v3 人工智能 机器人学

摘要

基于视觉的机器人操作策略近期取得了显著成功,但仍对相机视点变化等分布偏移表现脆弱。机器人演示数据稀缺,且通常缺乏足够的相机视点变化。仿真提供了一种大规模收集具有全面不同视点覆盖的机器人演示的方法,但带来了视觉上的sim2real挑战。为了弥合这一差距,我们提出了MANGO——一种非配对图像转换方法,该方法具有新颖的分割条件InfoNCE损失、高度正则化的判别器设计以及改进的PatchNCE损失。我们发现这些元素对于在sim2real转换过程中保持视点一致性至关重要。在训练MANGO时,我们只需要来自真实世界的少量固定相机数据,但表明我们的方法可以通过转换仿真观察来生成多样化的未见视点。在此设置下,MANGO优于我们测试的所有其他图像转换方法。在某些真实世界桌面操作任务中,与未使用数据增强训练的策略相比,MANGO数据增强将视点偏移成功率提高了超过40个百分点。

关键词

引用

@article{arxiv.2601.09605,
  title  = {Sim2real Image Translation Enables Viewpoint-Robust Policies from Fixed-Camera Datasets},
  author = {Jeremiah Coholich and Justin Wit and Robert Azarcon and Zsolt Kira},
  journal= {arXiv preprint arXiv:2601.09605},
  year   = {2026}
}