中文

VGGT-Det:挖掘VGGT内部先验用于无传感器几何的多视角室内3D目标检测

计算机视觉与模式识别 2026-03-03 v1

摘要

当前的多视角室内3D目标检测器依赖于难以获取的传感器几何(即精确校准的多视角相机姿态)来融合多视角信息以构建全局场景表示,限制了其在实际场景中的部署。我们聚焦于更实用的场景:无传感器几何(SG-Free)的多视角室内3D目标检测,即不依赖传感器提供的几何输入(多视角姿态或深度)。近期的Visual Geometry Grounded Transformer(VGGT)表明,强大的3D线索可直接从图像中推断。基于此洞察,我们提出VGGT-Det—the first针对SG-Free多视角室内3D目标检测的框架。不同于仅消费VGGT预测,我们的方法将VGGT编码器集成到基于变换器的管道中。为有效利用VGGT内部的语义和几何先验,我们引入两个新型关键组件:(i) Attention-Guided Query Generation(AG):利用VGGT注意力图作为语义先验初始化对象查询,通过聚焦目标区域同时保持全局空间结构来提高局部分辨;(ii) Query-Driven Feature Aggregation(QD):一种可学习的See-Query与对象查询交互以'看见'其所需内容,然后动态聚合跨VGGT层的多级几何特征,这些特征逐层提升2D特征至3D。实验表明,VGGT-Det在SG-Free设置下显著优于最佳方法,分别在ScanNet和ARKitScenes上的[email protected]提升了4.4和8.6。消融研究表明,VGGT内部学习的语义和几何先验可被我们的AG和QD有效利用。

关键词

引用

@article{arxiv.2603.00912,
  title  = {VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection},
  author = {Yang Cao and Feize Wu and Dave Zhenyu Chen and Yingji Zhong and Lanqing Hong and Dan Xu},
  journal= {arXiv preprint arXiv:2603.00912},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Code Page: https://github.com/yangcaoai/VGGT-Det-CVPR2026