中文

模拟中的操作:机器人几何感知的准确性

机器人学 2025-09-03 v1 人工智能 计算机视觉与模式识别

摘要

现代机器人操作主要依赖于二维彩色空间的视觉观察进行技能学习,但存在泛化性差的问题。相比之下,人类生活在三维世界中,更多依赖物理属性——如距离、大小和形状——而非纹理来与物体交互。由于这种三维几何信息可通过广泛可用的深度相机获取,因此似乎可行地为机器人赋予类似的感知能力。我们的初步研究发现,仅使用深度相机进行操作具有挑战性,主要源于其精度有限且易受各种噪声影响。在本文中,我们提出了深度相机模型 (CDMs),作为日常使用的深度相机的简单插件,输入为 RGB 图像和原始深度信号,输出为去噪后的准确度量深度。为实现这一目标,我们开发了神经数据引擎,通过建模深度相机的噪声模式,从仿真中生成高质量的配对数据。我们的结果表明,CDMs 在深度预测方面几乎达到仿真水平,有效弥合了仿真与现实之间的差距。值得注意的是,我们的实验首次表明,在不添加噪声或现实世界微调的情况下,基于原始仿真深度训练的策略能无缝地推广到两个具有挑战性的长期程度任务中,这些任务涉及可动、反射和细长物体,几乎没有性能下降。我们希望我们的发现能激发未来研究,利用仿真数据和三维信息来提升通用机器人策略。

关键词

引用

@article{arxiv.2509.02530,
  title  = {Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots},
  author = {Minghuan Liu and Zhengbang Zhu and Xiaoshen Han and Peng Hu and Haotong Lin and Xinyao Li and Jingxiao Chen and Jiafeng Xu and Yichu Yang and Yunfeng Lin and Xinghang Li and Yong Yu and Weinan Zhang and Tao Kong and Bingyi Kang},
  journal= {arXiv preprint arXiv:2509.02530},
  year   = {2025}
}

备注

32 pages, 18 figures, project page: https://manipulation-as-in-simulation.github.io/