中文

面向无限流的视觉几何 grounding Transformer —— InfiniteVGGT

计算机视觉与模式识别 2026-01-06 v1

摘要

使持久化、大规模 3D 视觉几何理解的宏大愿景受到可扩展性和长期稳定性之间不可调和需求的制约。虽然离线模型如 VGGT 实现了惊人的几何能力,但其基于批处理的性质使其在实时系统中无关紧要。虽然有流式架构旨在解决实时操作问题,但证明它们不足。现有方法要么无法支持真正的无限视野输入,要么在长序列上出现恶性漂移。我们通过 InfiniteVGGT 打破了这一长期困境,这是一个因果视觉几何变换器,通过一个有界且自适应且永远可表达的 KV 缓存来实现滚动记忆的概念。凭借这一点,我们设计了一个无需训练、无注意力依赖的修剪策略,智能地丢弃过时的信息,有效地在每个新帧上向前滚动记忆。完全兼容 FlashAttention,InfiniteVGGT 终于消除了这种权衡,使无限视野流式处理成为可能,同时在长期稳定性方面优于现有流式方法。对于此类系统而言,最严格的测试是其在真正无限视野上的表现,这一能力长期以来一直不可能进行严格验证,因为缺乏极端长期、连续的基准。为此,我们引入了 Long3D 基准,该基准首次 enables 对约 10,000 帧的连续 3D 几何估计进行严格评估。这为未来在长期 3D 几何理解领域的研究提供了确定性的评估平台。代码可在 https://github.com/AutoLab-SAI-SJTU/InfiniteVGGT 获取。

关键词

引用

@article{arxiv.2601.02281,
  title  = {InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams},
  author = {Shuai Yuan and Yantai Yang and Xiaotian Yang and Xupeng Zhang and Zhonghao Zhao and Lingming Zhang and Zhipeng Zhang},
  journal= {arXiv preprint arXiv:2601.02281},
  year   = {2026}
}