一种用于视觉Transformer的统一剪枝框架
计算机视觉与模式识别
2021-12-01 v1
摘要
近来,视觉Transformer(ViT)及其变体在各种计算机视觉任务中取得了令人瞩目的性能。然而,ViT的高计算成本与训练数据需求限制了其在资源受限环境中的应用。模型压缩是加速深度学习模型的有效方法,但对ViT的压缩研究尚不充分。许多先前工作集中于减少token数量。然而,此类方法破坏了ViT的空间结构,难以推广至下游任务。本文中,我们设计了一个用于ViT及其变体结构剪枝的统一框架,即UP-ViTs。我们的方法侧重于剪枝ViT的所有组件,同时保持模型结构的一致性。丰富的实验结果表明,我们的方法在压缩后的ViT及变体上可实现高准确率,例如UP-DeiT-T在ImageNet上达到75.79%的准确率,在以相同计算成本下优于原始DeiT-T 3.59%。UP-PVTv2-B0在ImageNet分类上将PVTv2-B0的准确率提升了4.83%。同时,UP-ViTs保持了token表示的一致性,并在目标检测任务上获得了一致的提升。
引用
@article{arxiv.2111.15127,
title = {A Unified Pruning Framework for Vision Transformers},
author = {Hao Yu and Jianxin Wu},
journal= {arXiv preprint arXiv:2111.15127},
year = {2021}
}