追逐视觉 Transformer 中的稀疏性:一项端到端探索
计算机视觉与模式识别
2021-10-26 v3 人工智能
摘要
视觉 Transformer(ViT)近期受到爆发式关注,但其庞大的模型规模与训练代价仍令人望而生畏。传统的训练后剪枝往往带来更高的训练开销。相比之下,本文旨在削减训练内存开销与推理复杂度,同时不牺牲可达精度。我们开展了首创性的全面探索,研究以统一方法将稀疏性“端到端”地融入 ViT。具体而言,我们并非训练完整的 ViT,而是动态提取并训练稀疏子网络,同时维持固定的较小参数预算。我们的方法联合优化模型参数并在整个训练过程中探索连接性,最终输出一个稀疏网络。该方法可无缝地从非结构化稀疏扩展到结构化稀疏,后者通过引导 ViT 内部自注意力头的剪枝与生长来实现。我们进一步协同探索数据与架构稀疏性,通过插入一个新颖的可学习 token 选择器来自适应确定当前最关键的图像块,以获得额外效率收益。在 ImageNet 上基于多种 ViT 骨干网络的广泛结果验证了我们所提方案的有效性,其显著降低了计算代价且几乎未损泛化能力。或许最令人惊讶的是,我们发现所提的稀疏(协同)训练有时能提升而非损害 ViT 精度,使稀疏性成为诱人的“免费午餐”。例如,我们在(数据,架构)稀疏度(5%,50%)下稀疏化的 DeiT-Small 提升了 0.28% 的 top-1 精度,同时节省了 49.32% 的 FLOPs 与 4.40% 的运行时间。我们的代码见 https://github.com/VITA-Group/SViTE。
引用
@article{arxiv.2106.04533,
title = {Chasing Sparsity in Vision Transformers: An End-to-End Exploration},
author = {Tianlong Chen and Yu Cheng and Zhe Gan and Lu Yuan and Lei Zhang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2106.04533},
year = {2021}
}
备注
NeurIPS 2021