中文

让几何引导:多模态大语言模型中几何先验的逐层展开

计算机视觉与模式识别 2026-04-08 v1

摘要

多模态大语言模型(MLLM)在二维视觉任务上取得了显著进展,但在处理真实世界视觉流时仍表现出有限的物理空间感知。最近,提取几何先验的前馈几何基础模型为解决此问题提供了新途径。然而,现有的几何感知MLLM主要受限于单深层提取和输入级融合的范式。这种扁平化融合导致局部几何细节的丢失,并在早期层引发语义不匹配。为突破这一瓶颈,本文提出GUIDE(多模态大语言模型早期层中的几何展开),一种渐进式几何先验注入框架。GUIDE在几何编码器中进行多级采样,全面捕获从局部边缘到全局拓扑的多粒度特征。随后,我们严格对齐并逐步将这些多级几何先验与MLLM的早期层融合。基于多粒度几何信息的注入,该设计引导模型逐步学习二维到三维的过渡过程。此外,本文引入上下文感知门控,使模型能够根据当前语义获取所需的空间线索,从而最大化空间先验的利用效率并有效抑制冗余的几何噪声。大量实验表明,GUIDE在多个复杂空间推理和感知任务上显著优于现有基线,为将三维几何先验集成到大模型中建立了新范式。

关键词

引用

@article{arxiv.2604.05695,
  title  = {Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs},
  author = {Chongyu Wang and Ting Huang and Chunyu Sun and Xinyu Ning and Di Wang and Hao Tang},
  journal= {arXiv preprint arXiv:2604.05695},
  year   = {2026}
}