中文

HTTM:面向更快VGGT的头部级时序记token合并

计算机视觉与模式识别 2025-11-27 v1

摘要

Visual Geometry Grounded Transformer(VGGT)是3D场景重建领域的重大突破,是首个直接在一次前向传播中推断所有关键3D属性(相机姿态、深度和稠密几何)的模型。然而,这种联合推断机制需要执行全局注意力层,对来自所有视角的token进行全连接注意力计算。在输入序列较长的大场景重建中,这导致显著的延迟瓶颈。本文提出了head-wise temporal merging(HTTM),一种用于加速VGGT的训练-free 3D token合并方法。现有合并技术在不同注意力头上对token进行统一合并,导致网络输出层中产生相同token,限制了模型的表示能力。HTTM通过在多头粒度上进行token合并,保留了层级连接后特征token的唯一性。此外,这使HTTM能够利用在头部层级上观察到的空间局部性和时序对应性,以较低的合并成本实现更高的合并比率。因此,HTTM在GPU推理中实现了最高7倍的加速,同时在性能上几乎没有波动。

关键词

引用

@article{arxiv.2511.21317,
  title  = {HTTM: Head-wise Temporal Token Merging for Faster VGGT},
  author = {Weitian Wang and Lukas Meiner and Rai Shubham and Cecilia De La Parra and Akash Kumar},
  journal= {arXiv preprint arXiv:2511.21317},
  year   = {2025}
}