中文

TurboVGGT:基于自适应交替注意力的快速视觉几何重建

计算机视觉与模式识别 2026-05-15 v1

摘要

近期的前馈式 3D 重建方法,如视觉几何 Transformer,通过在单次前向传递中实现有效的多视图重建,极大地推进了传统的逐场景优化范式。然而,大多数现有方法难以在重建质量和计算效率之间取得平衡,这限制了它们的可扩展性和效率。尽管最近出现了一些高效的视觉几何 Transformer,但它们通常在所有层和帧上使用相同的稀疏比率,并且缺乏自适应学习代表性 token 以捕获全局关系的机制,导致性能次优。在本工作中,我们提出了 TurboVGGT,这是一种采用具有自适应交替注意力的高效视觉几何 Transformer 来实现快速多视图 3D 重建的新方法。具体而言,TurboVGGT 采用了端到端可训练的框架,该框架利用由自适应稀疏选择引导的自适应稀疏全局注意力来捕获跨帧的全局关系,并利用帧注意力来聚合每帧内的局部细节。在自适应稀疏全局注意力中,TurboVGGT 考虑到不同帧间的 token 重要性存在差异、注意力层在不同抽象级别上操作 token 以及全局依赖关系依赖于结构信息丰富的区域,从而自适应地学习具有不同稀疏级别的代表性 token 以进行全局几何建模。在多个 3D 重建基准上的广泛实验表明,与 SOTA 方法相比,TurboVGGT 在保持具有竞争力的重建质量的同时实现了快速的多视图重建。项目页面:https://turbovggt.github.io/。

关键词

引用

@article{arxiv.2605.14315,
  title  = {TurboVGGT: Fast Visual Geometry Reconstruction with Adaptive Alternating Attention},
  author = {David Huang and Guile Wu and Chengjie Huang and Bingbing Liu and Dongfeng Bai},
  journal= {arXiv preprint arXiv:2605.14315},
  year   = {2026}
}

备注

Technical Report