中文

OVGGT:O(1)常数开销的流式视觉几何Transformer

计算机视觉与模式识别 2026-04-30 v3

摘要

从流式视频重建3D几何图形需要在受限资源下的持续推理。最近的几何基础模型通过全连接注意力实现了令人印象深刻的重建质量,但其二次计算成本将其限制在短序列、离线场景中。因果注意变体如StreamVGGT实现了单次通过式流式推理,但会累积不断增长的KV缓存,在数百帧后耗尽GPU内存,阻止了最初驱动流式推理的长期范围部署。我们提出了OVGGT,一个训练自由框架,将内存和计算都限制在固定预算内,无论序列长度如何。我们的methods结合了自选择性缓存,这利用FFN残差幅度压缩KV缓存,同时完全兼容FlashAttention,外加动态锚点保护,这保护坐标关键token免受驱逐,以抑制长期轨迹上的几何漂移。广泛的实验在室内、户外和超长序列基准测试上表明,OVGGT在恒定的VRAM框架下处理任意长度视频,同时实现了最先进的3D几何精度。项目页面:https://vaisr.github.io/OVGGT/ 代码:https://github.com/VAISR/OVGGT

关键词

引用

@article{arxiv.2603.05959,
  title  = {OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer},
  author = {Si-Yu Lu and Po-Ting Chen and Hui-Che Hsu and Sin-Ye Jhong and Wen-Huang Cheng and Yung-Yao Chen},
  journal= {arXiv preprint arXiv:2603.05959},
  year   = {2026}
}

备注

Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT