中文

注意力本身即可检索:基于查询-键相似度检索的无训练长上下文流式 3D 重建

计算机视觉与模式识别 2026-05-12 v1

摘要

视觉几何基础 Transformer(VGGT)通过可扩展的 Transformer 架构推进了 3D 重建,但全局注意力的二次复杂度阻碍了其在长上下文中的应用。StreamVGGT 利用因果注意力实现了流式处理,但其 KV 缓存随帧数线性增长,导致内存溢出和质量下降。我们提出了 RetrieveVGGT,一个无训练框架,将 VGGT 的上下文构建表述为检索问题。通过在每一步检索固定数量的相关帧,VGGT 保持了可控的内存预算,该预算接近其训练上下文长度。有趣的是,我们发现当前帧查询与 VGGT 第一层全局注意力中缓存的历史帧键之间的相似度已经是相关性的强指标,从而无需额外的学习评分。为了增强类似于推荐系统的信息多样性,我们提出了片段采样,使检索能够跨越不同的相关片段,而不是单一的高相似度区域。我们设计了一种位姿感知空间记忆机制,根据已估计的相机位姿组织历史帧,从而实现位置感知检索。大量实验表明,RetrieveVGGT 实现了 SOTA 性能,在无论序列长度如何均保持恒定内存使用的情况下,优于 StreamVGGT、TTT3R 和 InfiniteVGGT。代码可在 https://github.com/zzctmd/RetrieveVGGT 获取。

关键词

引用

@article{arxiv.2605.09644,
  title  = {Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval},
  author = {Zichen Zou and Xiaosong Jia and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2605.09644},
  year   = {2026}
}