稀疏生长变换器:通过渐进注意力循环实现训练时稀疏深度分配
计算机视觉与模式识别
2026-03-27 v2
摘要
现有增加变换器有效深度的方法主要依赖参数复用,通过递归执行扩展计算。在此范式下,网络结构在训练时间轴上保持静态,额外的计算深度在参数层面均匀分配给整个块。这一在训练时间和参数空间上的刚性导致在训练期间出现显著的计算冗余。相反,我们认为深度在训练期间的分配不应是静态预设,而应是逐渐生长的结构过程。我们的系统分析揭示了跨层的深到浅的成熟轨迹,其中高熵注意力头在语义集成中发挥关键作用。基于此观察,我们引入稀疏生长变换器(Sparse Growing Transformer, SGT)。SGT 是一种训练时稀疏深度分配框架,通过针对信息丰富的注意力头进行有针对性的注意力循环,从深层到浅层逐渐扩展递归。这种机制通过在训练过程中仅为小数参数子集选择性地增加深度来诱导结构稀疏性。广泛的实验表明,在可比设置下,SGT 持续优于训练时静态块级循环基线,同时将额外训练 FLOPs 开销从约 16--20% 降低至仅 1--3% 相对于标准变换器 backbone。
引用
@article{arxiv.2603.23997,
title = {HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images},
author = {Yumeng Liu and Xiao-Xiao Long and Marc Habermann and Xuanze Yang and Cheng Lin and Yuan Liu and Yuexin Ma and Wenping Wang and Ligang Liu},
journal= {arXiv preprint arXiv:2603.23997},
year = {2026}
}
备注
project page: https://lym29.github.io/HGGT/