中文

自然语言有助于桥接 Sim2Real 差距

机器人学 2024-07-03 v2 计算与语言 计算机视觉与模式识别 机器学习

摘要

在学习图像条件机器人策略时,获取有利于低层控制的视觉表征是主要挑战。由于图像空间的高维性,学习良好的视觉表征需要大量视觉数据。然而,在现实世界中学习数据昂贵。Sim2Real 作为一种通过使用模拟器获取大量与目标任务紧密相关且廉价数据的范式, 是克服现实目标域数据稀缺的有前景的方案。然而,当域之间视觉差异很大时,将图像条件的策略从模拟迁移到现实很困难。为桥接 sim2real 视觉差距,我们提出使用自然语言描述图像作为跨域统一信号,捕捉与底层任务相关的语义。我们的关键洞察是:如果来自不同域的两个图像观测被标记为相似的语言,策略应对这两个图像预测相似的动作分布。我们证明,训练图像编码器以预测自然语言描述或模拟/真实图像描述之间的距离,作为有用的数据高效预训练步骤,有助于学习域不变的图像表征。我们可以将该图像编码器作为强化学习策略的骨干网络,同时在大量模拟演示和少量真实演示上进行训练。我们的方法在广泛使用的先前 sim2real 方法和强大的视觉-语言预训练基线(如 CLIP 和 R3M)之上提高了 25%~40%。详见 https://robin-lab.cs.utexas.edu/lang4sim2real/ 上的附加视频和材料。

关键词

引用

@article{arxiv.2405.10020,
  title  = {Natural Language Can Help Bridge the Sim2Real Gap},
  author = {Albert Yu and Adeline Foote and Raymond Mooney and Roberto Martín-Martín},
  journal= {arXiv preprint arXiv:2405.10020},
  year   = {2024}
}

备注

To appear in RSS 2024. Project website at https://robin-lab.cs.utexas.edu/lang4sim2real/