中文

Locate 3D:基于 3D 自监督学习的真实场景物体定位

计算机视觉与模式识别 2025-04-22 v1 人工智能 机器人学

摘要

我们提出了 LOCATE 3D,一种用于从指代表达式(如“ Sofa 和 台灯之间的小咖啡桌”)对 3D 场景中的物体进行定位的模型。LOCATE 3D 在标准的指代定位基准测试上取得了新的状态-of-the-art,展示了强大的泛化能力。值得注意的是,LOCATE 3D 直接处理传感器观测流(带姿态的 RGB-D 帧),能够在机器人和 AR 设备上实现实际部署。我们方法的关键在于 3D-JEPA,这是一种适用于传感器点云的新型自监督学习(SSL)算法。它以使用 2D 基础模型(CLIP、DINO)特征化的 3D 点云为输入。随后,在潜在空间中进行掩码预测作为预文本任务,以辅助学习带上下文信息的点云特征。训练完成后,3D-JEPA 编码器将与语言条件解码器一起微调,以联合预测 3D 掩码和边界框。此外,我们引入了 LOCATE 3D 数据集,这是一个用于 3D 指代定位的新数据集,涵盖多种捕获 setup,包含超过 13 万项标注。这使得能够系统性地研究泛化能力以及更强大的模型。

关键词

引用

@article{arxiv.2504.14151,
  title  = {Locate 3D: Real-World Object Localization via Self-Supervised Learning in 3D},
  author = {Sergio Arnaud and Paul McVay and Ada Martin and Arjun Majumdar and Krishna Murthy Jatavallabhula and Phillip Thomas and Ruslan Partsey and Daniel Dugas and Abha Gejji and Alexander Sax and Vincent-Pierre Berges and Mikael Henaff and Ayush Jain and Ang Cao and Ishita Prasad and Mrinal Kalakrishnan and Michael Rabbat and Nicolas Ballas and Mido Assran and Oleksandr Maksymets and Aravind Rajeswaran and Franziska Meier},
  journal= {arXiv preprint arXiv:2504.14151},
  year   = {2025}
}