通过神经架构搜索对预训练语言模型进行结构化剪枝
机器学习
2024-08-27 v2 计算与语言
摘要
预训练语言模型(PLM),例如 BERT 或 RoBERTa,在标注数据上进行微调后,代表了自然语言理解任务的最先进水平。然而,它们庞大的规模给在现实应用中部署推理带来了挑战,因为这会带来显著的 GPU 内存需求和高推理延迟。本文探索了用于结构化剪枝的神经架构搜索(NAS),以寻找微调网络的最优子部分,从而在效率(例如模型大小或延迟)与泛化性能之间实现最佳权衡。我们还展示了如何在此设置中利用最近发展的两阶段权重共享 NAS 方法来加速搜索过程。与具有固定阈值的传统剪枝方法不同,我们提出采用一种多目标方法,该方法能够识别帕累托最优子网络集合,从而实现更灵活、更自动化的压缩过程。
引用
@article{arxiv.2405.02267,
title = {Structural Pruning of Pre-trained Language Models via Neural Architecture Search},
author = {Aaron Klein and Jacek Golebiowski and Xingchen Ma and Valerio Perrone and Cedric Archambeau},
journal= {arXiv preprint arXiv:2405.02267},
year = {2024}
}