Q-GeoMem:基于问题引导的几何记忆用于视频空间推理
计算机视觉与模式识别
2026-05-27 v1
摘要
视频空间推理需要在时间内累积基于视点依赖证据,同时保留对提问有用的信息。现有的空间视频语言模型在几何感知和长程上下文建模方面取得了进展,但常将记忆当作通用的时序缓存,这可能引入冗余或不相关的几何信息,削弱长期推理能力。我们提出了 \textbf{\ours},一种用于视频空间推理的 question-guided 几何记忆框架。\ours 将相机条件化的几何信息注入视觉标记,维持两种互补记忆:用于最近密集特征和相机状态的细粒度上下文库,以及用于紧凑长程证据的语义几何证据库。每个候选帧的得分来自问题相关性与相对于保留库中新颖性的乘积;该得分被存储并在读取期间重用,同时基于容量的替换规则保持库紧凑。在推理过程中,这两种记忆在更新前都会被读取,并与当前帧表示自适应融合。在 VSI-Bench 和 VSTI-Bench 上的实验表明,\ours 在评估的空间推理模型中实现了最先进的性能,验证了 question-guided 几何记忆的有效性。进一步的消融实验验证了所提出证据评分机制的贡献。
引用
@article{arxiv.2605.27318,
title = {Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning},
author = {Xianqiang Gao and Qizhi Chen and Delin Qu and Haoming Song and Zhigang Wang and Bin Zhao and Dong Wang and Xuelong Li},
journal= {arXiv preprint arXiv:2605.27318},
year = {2026}
}