面向视觉几何变换器的预交错注意令稀释:PaceVGGT
计算机视觉与模式识别
2026-05-12 v1
摘要
视觉几何变换器(VGGT)是解决多种 3D 任务的强型前馈模型,但其交替注意(AA)堆栈在总令牌数上呈二次比例扩张,使得长时段成本高昂。现有的令牌减缓加速器 operate within AA,仍将进入 AA 的 patch grid 保持未压缩。我们引入 PaceVGGT,一种位于 AA 之前的令牌稀释框架,对冻结 VGGT 的第一个 AA 块之前对 DINO patch 令牌进行稀释。PaceVGGT 在 DINO 特征上训练一个轻量级 Token Scorer 来估计每个令牌的重要性。该评分器首先在未剪枝主干的 AA 内部注意力目标上进行蒸馏,然后在相机、深度和点图损失下进行细化。在每帧保留预算下固定主干可见序列长度,而在重要性自适应合并/剪枝分配下,在固定总合并预算下保留高显著性帧的残余内容。特征导向恢复模块重建预测头所需的稠密空间网格。在 ScanNet-50 和 7-Scenes 上,PaceVGGT 仍保持在重建质量-延迟前沿,同时降低了推理延迟。在 ScanNet-50 上,相对于未修改的 VGGT 在 N=300 时降低了 的延迟,相对于 LiteVGGT 在 N=1000 时降低了 。这些结果表明,预-AA 稀释是冻结 VGGT 类几何变换器的可行加速路径。
引用
@article{arxiv.2605.08371,
title = {PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers},
author = {Haotang Li and Zhenyu Qi and Shaohan Henry Wang and Kebin Peng and Zi Wang and Qing Guo and Sen He and Huanrui Yang},
journal= {arXiv preprint arXiv:2605.08371},
year = {2026}
}