USDC:面向视觉Transformer的静态与动态统一压缩方法
计算机视觉与模式识别
2023-10-18 v1 人工智能
摘要
视觉Transformer在几乎所有视觉任务(如分类、检测等)中都取得了巨大成功。然而,视觉Transformer的模型复杂度和推理速度阻碍了它们在工业产品中的部署。各种模型压缩技术侧重于直接将视觉Transformer压缩为更小的模型,同时保持模型性能,但当压缩比很大时,性能会急剧下降。此外,若干动态网络技术也被应用于在推理阶段动态压缩视觉Transformer,以获得输入自适应的高效子结构,从而能在压缩比与模型性能之间实现更好的权衡。由于完整的原始视觉Transformer模型与额外的控制门控模块需一同加载到设备上进行推理,动态模型在实际部署中的内存上限并未降低。为缓解这两类方法的两个缺点,我们提出将静态压缩与动态压缩技术联合统一,以获得输入自适应的压缩模型,从而能进一步更好地平衡总压缩比与模型性能。此外,在实际部署中,训练阶段与推理阶段的批大小通常不同,这会导致模型推理性能劣于训练性能,而以往所有动态网络论文均未触及此问题。我们提出子组门增强技术来解决这一性能下降问题。大量实验证明了我们的方法在DeiT、T2T-ViT等多种基线视觉Transformer上的优越性。
引用
@article{arxiv.2310.11117,
title = {USDC: Unified Static and Dynamic Compression for Visual Transformer},
author = {Huan Yuan and Chao Liao and Jianchao Tan and Peng Yao and Jiyuan Jia and Bin Chen and Chengru Song and Di Zhang},
journal= {arXiv preprint arXiv:2310.11117},
year = {2023}
}
备注
This paper was actually finished in 2021