中文

哪种预训练范式更能服务于空间智能?对视觉语言模型和视频生成模型的实证比较

计算机视觉与模式识别 2026-05-28 v1

摘要

空间智能需要捕捉物理世界中语义对象和几何结构的视觉表征。为支持这一目标,两种主要预训练方案目前广泛用作基础模型:视觉语言模型(VLMs),它们使用语言监督将视觉观察与语义概念对齐;视频生成模型(VGMs),它们从随时间演化的视觉世界中学习。然而,仍不清楚哪种预训练方案为空间智能提供更好的表征基石。本文提出了首个针对VLMs和VGMs在三个代表性空间智能轴向(语义标记、实例分组和3D几何预测)上的系统性冻结特征探针研究。通过轻量级探针框架,我们实现了对两种模型家族中冻结表征中已编码信息的受控比较。实验结果揭示了明确的互补性:VLMs在语义标记和实例分组方面更强大,而VGMs在稠密几何和相机运动方面提供更易获取的信号。此外,简单地将两种方法融合即可获得在几何和语义方面都卓越的表征,表明通过有效整合两种模型家族的特征,构建更强大的空间智能底层模型是一个具有前景的方向。我们的代码可在\href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM}获取。

关键词

引用

@article{arxiv.2605.28132,
  title  = {Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models},
  author = {Haozhan Shen and Tiancheng Zhao and Kangjia Zhao and Jianwei Yin},
  journal= {arXiv preprint arXiv:2605.28132},
  year   = {2026}
}

备注

Code is here: \href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM}