SPDF:面向大语言模型的稀疏预训练与稠密微调
机器学习
2023-08-01 v2 计算与语言
摘要
预训练与微调范式已为自然语言处理(NLP)领域的多项突破做出贡献。语言模型首先在大规跨域知识数据集(如 Pile、MassiveText 等)上预训练,然后在特定任务数据(如自然语言生成、文本摘要等)上微调,而非直接在下游任务上训练。扩展模型与数据集规模有助于提升 LLM 性能,但不幸的是,这也导致了极高的计算成本。预训练 LLM 通常比微调所需 FLOPs 高出数个数量级,且两阶段模型容量往往保持不变。为实现训练 FLOPs 方面的训练效率,我们提出解耦两阶段的模型容量,并引入稀疏预训练与稠密微调(SPDF)。本工作中,我们展示了使用非结构化权重稀疏性在预训练期间仅训练权重子集(稀疏预训练),随后通过允许置零权重学习来恢复表征能力(稠密微调)的优势。我们证明可将 1.3B 参数的 GPT-3 XL 模型诱导出高达 75% 的稀疏度,使预训练 FLOPs 减少 2.5 倍,且相对于稠密基线在下游任务上的精度无显著损失。通过对多个下游任务的严格评估,我们还建立了稀疏度、任务复杂度与数据集规模之间的关系。我们的工作为以极少部分训练 FLOPs 使用权重稀疏性训练大型 GPT 模型,同时保留预训练文本表征对下游任务的益处,提供了一个有前景的方向。
引用
@article{arxiv.2303.10464,
title = {SPDF: Sparse Pre-training and Dense Fine-tuning for Large Language Models},
author = {Vithursan Thangarasa and Abhay Gupta and William Marshall and Tianda Li and Kevin Leong and Dennis DeCoste and Sean Lie and Shreyas Saxena},
journal= {arXiv preprint arXiv:2303.10464},
year = {2023}
}
备注
Accepted to Uncertainty in Artificial Intelligence (UAI) 2023 Conference; 13 pages, 4 figures (Main Paper) + 5 pages (Supplementary Material)