DSEE:嵌入双重稀疏性的预训练语言模型高效微调框架
机器学习
2023-05-25 v3 计算与语言
摘要
庞大的预训练模型已成为自然语言处理(NLP)的核心,作为面向一系列下游任务进行微调的起点。然而,这一范式仍存在两个痛点:(a) 随着预训练模型变得更大(例如 GPT-3 具有 175B 参数),即便微调过程也可能耗时且计算昂贵;(b) 默认情况下,微调后的模型与其起点大小相同,这既因其更专门的功能而不合理,也不实用,因为许多微调模型将部署在资源受限的环境中。为解决这些痛点,我们提出了一种利用权重更新与最终模型权重中稀疏性先验的资源和参数高效微调框架。我们提出的框架称为双重稀疏性嵌入高效微调(DSEE),旨在实现两个关键目标:(i) 参数高效微调——通过在预训练权重之上施加稀疏感知的低秩更新;(ii) 资源高效推理——促使最终微调模型趋向稀疏权重结构。我们通过统一方法利用预训练语言模型中非结构与结构化稀疏模式,在这两个方向上利用稀疏性。在数十个数据集上以多种网络骨干(即 BERT、RoBERTa 和 GPT-2)进行的广泛实验与深入探究,一致展示了令人印象深刻的参数/推理效率,同时保持了有竞争力的下游性能。例如,DSEE 在 BERT 上以 0.5% 可训练参数节省了约 25% 推理 FLOPs,同时取得可比性能。代码见 https://github.com/VITA-Group/DSEE。
引用
@article{arxiv.2111.00160,
title = {DSEE: Dually Sparsity-embedded Efficient Tuning of Pre-trained Language Models},
author = {Xuxi Chen and Tianlong Chen and Weizhu Chen and Ahmed Hassan Awadallah and Zhangyang Wang and Yu Cheng},
journal= {arXiv preprint arXiv:2111.00160},
year = {2023}
}
备注
Accepted by ACL 2023