中文

3D原语是VLMs的空间语言

计算机视觉与模式识别 2026-05-14 v1 人工智能 数据库

摘要

视觉语言模型(VLMs)呈现出一种 striking 的悖论:它们能够生成可执行代码来重建3D场景的几何原语,包括正确的对象计数、类别和大致位置;但相同模型在同一图像上的简单空间问题上却难掌握。我们表明,3D几何原语(立方体、球体、圆柱体,以可执行代码表达)是空间理解的强大中间表示,我们通过三方面的贡献加以利用。第一,我们引入\textbf{\textsc{SpatialBabel}},用于评估十四种VLMs在基于原语的3D场景重建中的表现,涵盖六种scene-code语言(用于3D原语场景的编程语言和声明式格式),揭示单个模型的对象检测F1分数在不同语言间可差异最高达5.7×5.7\times。第二,我们提出\textbf{Code-CoT}(Code Chain-of-Thought),一种无需训练的推理策略,通过原语化代码生成来路由空间推理。Code-CoT在原语场景和real-photo CV-Bench-3D上的准确率分别提升最高可达+6.4%和+5.0%。第三,我们提出\textbf{S3^3-FT}(Self-Supervised Spatial Fine-Tuning),通过解析模型自身的Three.js原语重建生成结构化注释并在结果上进行微调,实现对几何原语空间知识的无监督蒸馏,既无需人工标签也无需教师模型。仅在原语图像上训练,S3^3-FT使Qwen3-VL-8B在SpatialBabel-Primitive-QA上提升4.6至8.6%,在CV-Bench-2D上提升9.7%,在HallusionBench上提升17%;该配方可跨模型家族迁移。这些结果确立了代码中的几何原语既是诊断工具也是可迁移的空间词汇。我们将在发表时发布所有制品。

关键词

引用

@article{arxiv.2605.12586,
  title  = {3D Primitives are a Spatial Language for VLMs},
  author = {Junze Liu and Kun Qian and Florian Dubost and Kai Zhong and Arvind Srinivasan and Nan Chen and Anping Wang and Sam Zhang and Alejandro Mottini and Qingjun Cui and Tian Wang},
  journal= {arXiv preprint arXiv:2605.12586},
  year   = {2026}
}