中文

LocateAnything3D:基于链式视角感知的视觉语言 3D 检测

计算机视觉与模式识别 2026-02-24 v2

摘要

为了在世界中行动,模型必须命名它看到的内容,并知道它在 3D 中的位置。今天的视觉语言模型(VLM)在开放式 2D 描述和定位方面表现出色,但多目标 3D 检测仍基本缺席于 VLM 工具箱中。我们提出 LocateAnything3D,一种 VLM 原生配方,将 3D 检测表述为下一个标记预测问题。关键在于一个简短且明确的链式视角感知(Chain-of-Sight, CoS)序列,镜像人类从图像中推理的方式:找到 2D 中的一个对象,然后推断其距离、大小和姿态。解码器首先发出 2D 检测作为视觉链式思考,然后在易到难的课程下预测 3D 边界框:跨对象、近到远的顺序减少早期歧义并匹配自我中心实用性;在每个对象内部,中心-从-相机、维度和旋转分解按稳定性和可学习性对信息进行排序。这一 VLM 原生界面保留了开放词汇和视觉提示功能,而无需专用头。在具有挑战性的 Omni3D 基准上,我们的模型实现了最先进的结果,3D 检测平均精度(AP_3D)达 38.90,甚至在基线获得ground-truth 2D 边界框时,也比前往最佳提升了 +13.98 的绝对值。它还在零样本 held-out 类别上实现了强大的鲁棒性。通过将 3D 检测转化为一种纪律化的下一个标记问题,LocateAnything3D 为模型在 3D 中感知提供了实用的基础。

关键词

引用

@article{arxiv.2511.20648,
  title  = {LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight},
  author = {Yunze Man and Shihao Wang and Guowen Zhang and Johan Bjorck and Zhiqi Li and Liang-Yan Gui and Jim Fan and Jan Kautz and Yu-Xiong Wang and Zhiding Yu},
  journal= {arXiv preprint arXiv:2511.20648},
  year   = {2026}
}

备注

Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/