中文

从任意图像进行机器人学习

机器人学 2025-10-09 v2 计算机视觉与模式识别 机器学习

摘要

我们介绍了RoLA,一个将任何自然图像转换为交互式、物理启用的机器人环境的框架。与以往方法不同,RoLA直接对单张图像进行操作,无需额外的硬件或数字资产。我们的框架通过从广泛的图像源(包括相机拍摄、机器人数据集和互联网图像)在几分钟内生成大量的视觉运动机器人演示,使机器人数据生成大众化。其核心在于,我们的方法结合了一种新颖的单视图物理场景恢复方法和一种用于逼真数据收集的高效视觉混合策略。我们展示了RoLA在可扩展机器人数据生成与增强、从互联网图像进行机器人学习以及用于机械臂和类人机器人的单图像真实到仿真到真实系统等应用中的多功能性。视频结果可在 https://sihengz02.github.io/RoLA 获取。

关键词

引用

@article{arxiv.2509.22970,
  title  = {Robot Learning from Any Images},
  author = {Siheng Zhao and Jiageng Mao and Wei Chow and Zeyu Shangguan and Tianheng Shi and Rong Xue and Yuxi Zheng and Yijia Weng and Yang You and Daniel Seita and Leonidas Guibas and Sergey Zakharov and Vitor Guizilini and Yue Wang},
  journal= {arXiv preprint arXiv:2509.22970},
  year   = {2025}
}

备注

CoRL 2025 camera ready