UPop:用于压缩视觉-语言 Transformer 的统一渐进剪枝
计算机视觉与模式识别
2023-07-03 v3 计算与语言
机器学习
摘要
真实世界数据包含大量多模态信息,其中视觉与语言是最具代表性的两种模态。此外,日益沉重的模型(如 Transformers)引起了研究者对模型压缩的关注。然而,如何压缩多模态模型,尤其是视觉-语言 Transformers,仍鲜有探索。本文提出 \textbf{U}nified and \textbf{P}r\textbf{o}gressive \textbf{P}runing(\textbf{\emph{UPop}})作为一种通用的视觉-语言 Transformer 压缩框架,其包含:1)从原始模型在连续优化空间中统一搜索多模态子网络,从而能够在可压缩模态与结构间自动分配剪枝比例;2)渐进式搜索并重新训练子网络,维持搜索与重训练间的收敛以达成更高压缩比。在多种任务、数据集和模型架构上的实验证明了所提 UPop 框架的有效性与通用性。代码见 https://github.com/sdc17/UPop。
引用
@article{arxiv.2301.13741,
title = {UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers},
author = {Dachuan Shi and Chaofan Tao and Ying Jin and Zhendong Yang and Chun Yuan and Jiaqi Wang},
journal= {arXiv preprint arXiv:2301.13741},
year = {2023}
}
备注
ICML 2023. Website: https://dachuanshi.com/UPop-Project