HiAP:面向视觉 Transformer 的多粒度随机自修剪框架
计算机视觉与模式识别
2026-03-13 v1 机器学习
摘要
视觉 Transformer 需要大量计算资源和内存带宽,严重限制了其在边缘设备上的部署。虽然最近的结构化剪枝方法成功减少了理论 FLOPs,但通常仅在单一结构粒度上运行,依赖复杂的多阶段管道并通过事后阈值化来满足稀疏预算。本文提出了分层自修剪 (HiAP),是一个连续松弛框架,在单个端到端训练阶段发现最优子网络,无需手动重要性启发式或预定义每层稀疏目标。HiAP 在多个粒度上引入随机 Gumbel-Sigmoid 门:宏观门用于剪枝整个注意力头和 FFN 块,微观门用于选择性剪枝注意力头内的维度和 FFN 神经元。通过同时优化两个层次,HiAP 解决了加载大型矩阵的内存绑定开销和计算绑定的数学运算。HiAP 自然会收敛到稳定的子网络,其损失函数包含结构可行性惩罚和分析 FLOPs。在 ImageNet 上的大量实验表明,HiAP 能自主发现高效架构,为模型如 DeiT-Small 树立了具竞争力的准确性-效率 Pareto 前沿,同时显著简化了部署管道,性能匹配复杂多阶段方法。
引用
@article{arxiv.2603.12222,
title = {HiAP: A Multi-Granular Stochastic Auto-Pruning Framework for Vision Transformers},
author = {Andy Li and Aiden Durrant and Milan Markovic and Georgios Leontidis},
journal= {arXiv preprint arXiv:2603.12222},
year = {2026}
}
备注
14 pages, 9 figures, 3 Tables