LAST: 学会在空间与时间中思考的通用视觉语言模型
计算机视觉与模式识别
2025-11-25 v1
摘要
人类能够从序列视觉观测中感知和理解三维空间与长视频。但视觉语言模型(VLMs)能否做到?近期研究表明,即使最先进的VLMs在理解三维空间和长视频方面仍然存在困难,尽管它们在典型视觉语言任务中表现强大。现有方法通常依赖专门的架构设计来分别提升三维任务和视频理解任务的性能。相比之下,我们提出LAST(LeArn to Think in Space and Time的缩写),仅以一组二维图像作为输入,联合提升通用VLMs的三维空间与长视频理解能力。LAST使VLMs在进行最终回答之前就在空间和时间维度中进行思考,构建三维空间和时间维度中的视觉思考轨迹。我们在两个场景中验证了LAST的有效性:1)零样本场景,直接提示专有模型;2)微调通用VLMs,使用包含三维空间和时间中思考轨迹的数据。我们展示了LAST在多个基准上的显著提升,包括3个空间理解任务、4个视频理解任务和3个图像理解任务。特别地,在零样本方式下,LAST在EgoSchema上实现了15.8%的提升,在VSI-Bench上相比Qwen2.5-VL-7B实现了8.3的提升。
引用
@article{arxiv.2511.19261,
title = {LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models},
author = {Shuai Wang and Daoan Zhang and Tianyi Bai and Shitong Shao and Jiebo Luo and Jiaheng Wei},
journal= {arXiv preprint arXiv:2511.19261},
year = {2025}
}