面向稳健零样本 3D 视觉定位的多一致 2D-3D 映射
计算机视觉与模式识别
2026-04-30 v1
摘要
零样本 3D 视觉定位(3DVG)是开放式具身 AI 关键能力。然而,现有方法因开放词汇 3D 提案质量差,受制于类别不准、几何不精确以及穷举多视角推理的空间冗余问题。为此,我们提出MCM-VG(Multiple Consistent 2D-3D Mappings for robust zero-shot 3D Visual Grounding),通过显式建立多一致 2D-3D 映射实现稳健的零样本 3DVG。MCM-VG不被动地依赖噪声 3D 线段,而是在三个基本维度上强制 2D-3D 一致性,以实现精准的目标定位和可靠的推理。首先,语义对齐模块通过 LLM驱动的查询解析和粗到细 2D-3D 匹配纠正类别偏差;其次,实例校正模块利用 VLM 指导的 2D 线段重建缺失目标,通过背投这些可靠的视觉先验在 3D 空间中建立准确的几何;最后,为消除空间冗余,视点蒸馏模块聚类 3D 摄像机方向,以提取最优视角。将这些最优 RGB 帧与鸟瞰视图地图配对形成简洁的视觉提示集,我们将最终的目标歧义化建模为面向视觉语言模型的多选推理任务。经 ScanRefer 和 Nr3D 数据集广泛评估表明,MCM-VG 在零样本 3D 视觉定位方面达到新 state-of-the-art。惊人地说,在 ScanRefer 上,MCM-VG 的 [email protected] 和 [email protected] 分别达到 62.0% 和 53.6%,显著超越了之前基线提高了 6.4% 和 4.0%。
引用
@article{arxiv.2604.26261,
title = {Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding},
author = {Yufei Yin and Jie Zheng and Qianke Meng and Zhou Yu and Minghao Chen and Jiajun Ding and Min Tan and Yuling Xi and Zhiwen Chen and Chengfei Lv},
journal= {arXiv preprint arXiv:2604.26261},
year = {2026}
}