VideoAnchor:强化子空间结构的视觉线索以实现连贯的视觉空间推理
计算机视觉与模式识别
2025-09-30 v1
摘要
多模态大语言模型(MLLMs)在视觉-语言对齐方面取得了显著进展,但在视觉空间推理方面仍存在局限。我们首先发现这一局限源于注意力机制:视觉 token 被语言 token 掩盖,导致模型无法在各帧间一致地识别相同的视觉线索。为应对这一挑战,我们在稀疏子空间聚类的自表达特性与 Transformer 的注意力机制之间建立了一种新颖的联系。基于这一洞察,我们提出了 VideoAnchor,一个即插即用的模块,利用子空间亲和性在无需重训练的情况下跨帧强化视觉线索,有效地将注意力锚定于共享的视觉结构。跨基准测试和骨干模型的广泛实验表明了持续的性能提升——例如,在使用 InternVL2-8B 和 Qwen2.5VL-72B 时,在 VSI-Bench 和 Video-MME(空间相关任务)上分别取得了 3.2% 和 4.6% 的提升——而定量分析则展示了更连贯的子空间划分和更强的视觉定位。我们的代码将在 https://github.com/feufhd/VideoAnchor 公开发布。
引用
@article{arxiv.2509.25151,
title = {VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning},
author = {Zhaozhi Wang and Tong Zhang and Mingyue Guo and Yaowei Wang and Qixiang Ye},
journal= {arXiv preprint arXiv:2509.25151},
year = {2025}
}
备注
16 pages, 6 figures