速成汤:单遍廉价剪枝集成可从大模型中抽取彩票票
机器学习
2023-06-21 v1 计算机视觉与模式识别
摘要
近年来,大型预训练Transformer因可通过微调广泛适配众多下游应用而备受瞩目,但其呈指数增长的参数量已成为即便使用工业标准硬件仅进行微调的主要障碍。近来,彩票票假设(LTH)及其变体被用于剪枝这些大型预训练模型,生成可达到与稠密模型相当性能的子网络,但LTH的实用性被迭代幅值剪枝(IMP)中重复的全训练与剪枝流程严重制约,且随模型增大而恶化。受近期模型汤(model soups)观察的启发——即多个模型微调后的权重可合并至更优极小值——我们提出速成汤剪枝(ISP),以原IMP成本的一小部分生成彩票票质量子网络,用计算高效的弱掩码生成与聚合流程替代IMP昂贵的中间剪枝阶段。具体而言,在掩码生成阶段,ISP采用少量不同训练协议与数据子集的迭代生成许多弱且含噪的子网络,并将其叠加以平均掉噪声,从而创建高质量去噪子网络。我们在两个流行的预训练大模型(迄今剪枝中未被探索的CLIP和BERT)及多个视觉与语言基准数据集上的大量实验与消融验证了ISP相对于若干最先进剪枝方法的有效性。代码见:\url{https://github.com/VITA-Group/instant_soup}
引用
@article{arxiv.2306.10460,
title = {Instant Soup: Cheap Pruning Ensembles in A Single Pass Can Draw Lottery Tickets from Large Models},
author = {Ajay Jaiswal and Shiwei Liu and Tianlong Chen and Ying Ding and Zhangyang Wang},
journal= {arXiv preprint arXiv:2306.10460},
year = {2023}
}
备注
Accepted in ICML 2023