基于外部滑动窗口Mamba记忆的持久长序列视频几何 grounding Transformer
计算机视觉与模式识别
2026-05-19 v1
摘要
视觉几何 grounding Transformer(VGGT)在高保真3D场景重建方面取得了新纪录。然而,随着序列长度的增加,这些模型因全局注意力的二次复杂度而在几何遗忘和累积漂移方面受到挑战,这主要是因为必须在截断的时序窗口内实现。为克服这种几何漂移,我们提出Mamba-VGGT,一个增强型VGGT框架,具备持久的长程推理能力。我们的关键贡献是引入滑动窗口Mamba(SWM)记忆模块,该模块在时序窗口之间维护一个显式的外部记忆 token。该模块利用选择性状态空间建模来提炼和传递全局几何先验,有效绕开了传统transformer的记忆限制。为将这些长期时序线索无缝集成到经过优化的空间特征中,我们提出零初始化空间记忆注入器。利用零卷积层,该注入器自适应地将持久记忆融合到 patch token 流中,确保结构稳定性和无缝特征对齐。广泛的实验表明,我们的方法在保持空间一致性和减少轨迹累积误差方面显著优于现有的VGGT-based方法。我们的工作为在广泛3D环境中实现几何 grounding 世界建模提供了可扩展的线性复杂度解决方案。
引用
@article{arxiv.2605.17478,
title = {Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory},
author = {Tianchen Deng and Zhenxiang Xiong and Nailin Wang and Fangjinhua Wang and Jiuming Liu and Jianfei Yang and Hesheng Wang},
journal= {arXiv preprint arXiv:2605.17478},
year = {2026}
}