中文

FastVGGT:视几何变换的训练-free 加速

计算机视觉与模式识别 2025-11-11 v2

摘要

3D 视觉的基础模型最近在 3D 感知方面展现出惊人的能力。然而,将这些模型扩展到长序列图像输入面临着推理时效率的显著挑战。本文我们对 VGGT——一种领先的前馈视几何模型进行了详细分析,识别其主要瓶颈。通过可视化,我们进一步发现注意力图中存在令人关注的 token 坍缩现象。基于这些发现,我们探索了在前馈视几何模型中应用 token 合并的潜力。鉴于 3D 模型独特的架构和任务特性,直接应用现有合并技术面临挑战。为此,我们提出了 FastVGGT,首次通过一种训练-free 机制在 3D 领域利用 token 合并,以加速 VGGT。我们设计了专为 3D 架构和任务量身定制的独特 token 分区策略,有效消除了冗余计算,同时保留了 VGGT 强大的重建能力。在多个 3D 几何基准上的大量实验验证了我们方法的有效性。值得注意的是,在 1000 张输入图像下,FastVGGT 相比 VGGT 实现了 4 倍的加速,同时缓解了长序列场景中的误差积累。这些发现凸显了 token 合并作为可扩展 3D 视觉系统原则性解决方案的潜力。代码已公开:https://mystorm16.github.io/fastvggt/。

关键词

引用

@article{arxiv.2509.02560,
  title  = {FastVGGT: Training-Free Acceleration of Visual Geometry Transformer},
  author = {You Shen and Zhipeng Zhang and Yansong Qu and Xiawu Zheng and Jiayi Ji and Shengchuan Zhang and Liujuan Cao},
  journal= {arXiv preprint arXiv:2509.02560},
  year   = {2025}
}