中文

GP3:一种基于多视图图像的三维几何感知机器人操作策略

机器人学 2025-09-22 v1 人工智能

摘要

有效的机器人操作依赖于对三维场景几何的精确理解,而获取此类几何最直接的方法之一是通过多视图观测。受此启发,我们提出了 GP3——一种利用多视图输入的三维几何感知机器人操作策略。GP3 采用空间编码器从 RGB 观测中推断密集的空间特征,从而能够估计深度和相机参数,进而生成专为操作量身定制的紧凑且富有表现力的三维场景表示。该表示与语言指令融合,并通过轻量级策略头转化为连续动作。综合实验表明,GP3 在模拟基准上始终优于 SOTA 方法。此外,GP3 能有效迁移到没有深度传感器或预建地图环境的真实机器人上,仅需极少的微调。这些结果突显了 GP3 作为一种实用的、与传感器无关的几何感知机器人操作解决方案的价值。

关键词

引用

@article{arxiv.2509.15733,
  title  = {GP3: A 3D Geometry-Aware Policy with Multi-View Images for Robotic Manipulation},
  author = {Quanhao Qian and Guoyang Zhao and Gongjie Zhang and Jiuniu Wang and Ran Xu and Junlong Gao and Deli Zhao},
  journal= {arXiv preprint arXiv:2509.15733},
  year   = {2025}
}