中文

连续视觉记忆:通过连续视觉标记提升视觉语言模型的感知与思考

计算机视觉与模式识别 2025-12-02 v2 人工智能 机器学习

摘要

视觉语言模型(VLMs)在语言空间中擅长推理,但在需要密集视觉感知的感知理解方面表现不佳,例如空间推理和几何意识。这种限制源于当前VLMs缺乏足够机制来捕获跨空间维度的密集视觉信息。在本工作中,我们引入Chain-of-Visual-Thought (COVT),一个框架,使VLMs不仅能在语言中推理,还能通过连续视觉标记——紧凑的感知线索编码——进行推理。在约20个标记的有限预算内,COVT从轻量级视觉专家蒸馏知识,捕获诸如2D外观、3D几何、空间布局和边缘结构等互补属性。在训练期间,带有COVT的VLMs自回归地预测这些视觉标记,以重建稠密监督信号(例如深度、分割、边缘和DINO特征)。在推理时,模型直接在连续视觉标记空间中推理,既保持效率,又可选地解码稠密预测以实现可解释性。在超过十个多样化感知基准测试(包括CV-Bench、MMVP、RealWorldQA、MMStar、WorldMedQA和HRBench)上的评估表明,将COVT集成到Qwen2.5-VL和LLaVA等强大的VLMs中,始终能提升性能3%至16%,并表明紧凑的连续视觉思考使更精确、更具 grounding 且更可解释的多模态智能成为可能。

关键词

引用

@article{arxiv.2511.19418,
  title  = {Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens},
  author = {Yiming Qin and Bomin Wei and Jiaxin Ge and Konstantinos Kallidromitis and Stephanie Fu and Trevor Darrell and XuDong Wang},
  journal= {arXiv preprint arXiv:2511.19418},
  year   = {2025}
}

备注

Project page: https://wakalsprojectpage.github.io/covt-website/