中文

交替梯度流效用:用于深层网络结构剪枝和动态路由的统一度量

计算机视觉与模式识别 2026-03-18 v2 机器学习 神经与进化计算

摘要

高效深度学习传统上依赖于静态启发式方法,如权重大小或激活敏感性 (如 Wanda、RIA)。虽然在非结构化环境中取得了成功,但我们注意到将这些度量应用于深层视觉网络的结构剪枝时存在关键局限性。这些当代度量因 magnitude bias 而受限,无法保持关键功能通道。为克服这一问题,我们提出一种受交替梯度流 (AGF) 启发的解耦动力学范式,利用绝对特征空间 Taylor 展开准确捕捉网络的结构“动力学效用”。首先,我们发现在极端稀疏性拐点处出现拓扑相变,AGF 成功地保持了基线功能并表现出拓扑隐式正则化,避免了从头训练的模型在结构上坍塌。其次,在转向无严格结构先验的体系结构时,我们揭示了面向视觉转换器 (ViT) 的稀疏瓶颈现象。通过梯度大小解耦分析,我们发现动态信号在收敛模型中受到信号压缩,导致其不适用于实际动态路由。最后,受到这些实证约束的驱动,我们设计了一种混合路由框架,将 AGF 指导的离线结构搜索与通过零成本物理先验实现的在线执行相分离。我们在大规模基准测试中验证了该范式:在 ImageNet-1K 上进行 75% 压缩压力测试时,AGF 有效避免了结构坍塌,传统度量会严重低于随机抽样。在 ImageNet-100 上系统部署用于动态推理时,我们的混合方法实现了帕累托最优效率。它大约降低了重型专家的使用量(实现约 0.92×\times 的总体估计成本),而不牺牲完整模型准确性。

关键词

引用

@article{arxiv.2603.12354,
  title  = {Alternating Gradient Flow Utility: A Unified Metric for Structural Pruning and Dynamic Routing in Deep Networks},
  author = {Tianhao Qian and Zhuoxuan Li and Jinde Cao and Xinli Shi and Leszek Rutkowski},
  journal= {arXiv preprint arXiv:2603.12354},
  year   = {2026}
}

备注

11 pages, 6 figures, 9 tables