中文

无需真实三维:将二维视觉与伪三维表示融合用于机器人操作学习

机器人学 2025-09-23 v1 人工智能

摘要

最近,视觉基机器人操作学习受到广泛关注并取得了显著进展。二维图像基和三维点云基策略学习代表了该领域的两种主要范式,近期研究表明后者在策略性能和泛化能力方面始终优于前者,这凸显了三维信息的价值与重要性。然而,三维点云基方法面临高数据获取成本的挑战,限制了其可扩展性和实际部署。为此,我们提出了一种新框架NoReal3D,引入3DStructureFormer——一种能够将单目图像转换为几何有意义的伪点云特征的可学习三维感知模块,有效融合二维编码器输出特征。特别地,生成的伪点云保留了几何和拓扑结构,我们设计了伪点云编码器以保留这些特性,使其适用于本框架。我们还研究了不同特征融合策略的有效性。该框架增强了机器人对三维空间结构的理解,同时完全消除了三维点云获取的高额成本。广泛的实验在各种任务上验证了本框架能够实现与三维点云方法相当的性能,且无需实际点云数据。

关键词

引用

@article{arxiv.2509.16532,
  title  = {No Need for Real 3D: Fusing 2D Vision with Pseudo 3D Representations for Robotic Manipulation Learning},
  author = {Run Yu and Yangdi Liu and Wen-Da Wei and Chen Li},
  journal= {arXiv preprint arXiv:2509.16532},
  year   = {2025}
}