中文

S-VGGT:面向可扩展3D基础模型的结构感知子场景分解

计算机视觉与模式识别 2026-03-19 v1

摘要

前馈式3D基础模型面临关键挑战:由全局注意力引入的二次计算成本,随输入长度增加而严重限制可扩展性。同时出现的加速方法,如token合并, operate at the token level。虽然它们提供局部节省,但所需的最近邻搜索引入不可取的开销。因此,这些技术未能解决稠密捕获数据中占主导地位的结构冗余问题。在本工作中,我们引入S-VGGT,一种在结构层面上解决冗余的新方法,大幅转移优化重点。我们首先利用初始特征构建稠密场景图,该图刻画结构场景冗余并指导后续场景分区。借助该图,我们软性地将帧分配到少数子场景中,确保分组平衡且几何过渡平滑。核心创新在于设计子场景共享公共参考帧,建立一种平行的几何桥梁,使其能够无需显式几何对齐即可独立且高度有效地进行处理。这种结构重组织通过根本性地消除全局注意力成本的根源,提供强大的内在加速。关键的是,S-VGGT完全与token级别加速方法正交,可无缝组合以实现叠加加速,同时不损害重建保真度。代码已公开于https://github.com/Powertony102/S-VGGT。

关键词

引用

@article{arxiv.2603.17625,
  title  = {S-VGGT: Structure-Aware Subscene Decomposition for Scalable 3D Foundation Models},
  author = {Xinze Li and Pengxu Chen and Yiyuan Wang and Weifeng Su and Wentao Cheng},
  journal= {arXiv preprint arXiv:2603.17625},
  year   = {2026}
}

备注

7 pages, 5 figures. Accepted by ICME 2026