中文

SpatialBoost:通过语言引导推理提升视觉表征

计算机视觉与模式识别 2026-03-24 v1

摘要

尽管大规模预训练视觉表征模型(即视觉编码器)在各种视觉任务中取得了显著成功,但它们主要基于 2D 图像数据进行训练,往往难以捕捉现实世界中物体与背景之间的 3D 空间关系,从而限制了其在许多下游应用中的效果。为此,我们提出了 SpatialBoost,一个可扩展框架,通过注入以语言表达的 3D 空间知识来增强现有视觉编码器的空间感知能力。核心思想是将密集的 3D 空间信息从 2D 图像转换为语言表达,然后通过大型语言模型(LLM)将此类空间知识注入视觉编码器。为此,我们采用多轮链式思维(Chain-of-Thought, CoT)推理过程,逐步融合密集的空间知识并构建层次化的空间理解。为验证有效性,我们将 SpatialBoost 应用于最新视觉编码器如 DINOv3,并在广泛的需要 3D 感知和通用视觉能力的基准测试上评估其性能提升。例如,SpatialBoost 将 DINOv3 在 ADE20K 上的 mIoU 从 55.9 提升至 59.7,实现了最新成果,净增 3.8%。

关键词

引用

@article{arxiv.2603.22057,
  title  = {SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning},
  author = {Byungwoo Jeon and Dongyoung Kim and Huiwon Jang and Insoo Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2603.22057},
  year   = {2026}
}

备注

35 pages; 7 figures