中文

何在何处:让视频大语言模型学习几何因果以实现3D定位

计算机视觉与模式识别 2025-10-21 v1

摘要

多模态3D定位在视觉语言模型(VLM)中引起广泛关注,以促进复杂环境中的空间推理。然而,这些模型存在严重的“2D语义偏差”,即过度依赖2D图像特征进行粗略定位,基本忽略3D几何输入,导致融合性能 suboptimal。本文提出一种新颖的训练框架,称为What-Where Representation Re-Forming(W2R2),通过解�odied representation learning 和 targeted shortcut suppression 来解决此问题。我们的 метод 从根本上重新塑造了模型的内部空间,通过将2D特征指定为“What”识别的语义灯塔,并将3D特征指定为“Where”定位的空间锚点,从而实现精确的3D定位,而无需修改推理架构。关键组件包括一个双目标损失函数,其中包含用于监督融合预测的Alignment Loss(通过适应的交叉熵实现多模态协同),以及Penalizes overly effective 2D-dominant pseudo-outputs的Pseudo-Label Loss(通过基于间隔的机制)。在ScanRefer和ScanQA上进行的实验表明,W2R2的有效性显而易见,尤其在杂乱的户外场景中,在局部定位准确性和鲁棒性方面都取得了显著提升。

关键词

引用

@article{arxiv.2510.17034,
  title  = {Where, Not What: Compelling Video LLMs to Learn Geometric Causality for 3D-Grounding},
  author = {Yutong Zhong},
  journal= {arXiv preprint arXiv:2510.17034},
  year   = {2025}
}