少样本下的密集 Vision Transformer 压缩
计算机视觉与模式识别
2024-03-28 v1
摘要
少样本模型压缩旨在仅利用极小的训练集(甚至无标签)将大模型压缩为更紧凑的模型。在实现少样本 CNN 压缩的高精度与低延迟方面,块级剪枝近期已成为一种领先技术。然而,Vision Transformer (ViT) 的少样本压缩在很大程度上仍未被探索,这带来了新的挑战。具体而言,传统 CNN 少样本方法中存在稀疏压缩问题,即只能生成极少数不同模型大小的压缩模型。本文提出了一种名为 DC-ViT 的新型少样本 ViT 压缩框架。DC-ViT 不丢弃整个块,而是选择性地移除注意力模块,同时保留并复用 MLP 模块的部分。DC-ViT 实现了密集压缩,可输出大量密集分布于模型复杂度范围内的压缩模型。DC-ViT 以 10 个百分点的显著优势超越了现有最先进的少样本压缩方法,并在 ViT 及其变体的压缩中具有更低的延迟。
引用
@article{arxiv.2403.18708,
title = {Dense Vision Transformer Compression with Few Samples},
author = {Hanxiao Zhang and Yifan Zhou and Guo-Hua Wang and Jianxin Wu},
journal= {arXiv preprint arXiv:2403.18708},
year = {2024}
}
备注
Accepted to CVPR 2024. Note: Jianxin Wu is a contributing author for the arXiv version of this paper but is not listed as an author in the CVPR version due to his role as Program Chair