稀疏升级:推理低效的微调
机器学习
2024-11-15 v1 计算与语言
摘要
小型且经过充分训练的开源大型语言模型因其推理效率高而广泛使用,但进一步提升其质量仍面临挑战。稀疏升级是一种有前景的做法,将预训练稠密模型转化为混合专家(Mixture-of-Experts, MoE)架构,从而增加模型参数数量和质量。本文比较了稀疏升级与持续预训练(Continued Pretraining, CPT)在不同模型规模、计算预算和预训练持续时间下的效果。我们的实验表明,在某些情景下,稀疏升级可实现比 CPT 高达20%以上的质量提升。然而,这伴随着显著的推理成本,在大型模型的高需求推理场景中导致约40%的性能下降。我们的发现凸显了模型质量与推理效率之间的权衡,为寻求在质量与部署约束之间取得平衡的实践者提供了洞见。
引用
@article{arxiv.2411.08968,
title = {Sparse Upcycling: Inference Inefficient Finetuning},
author = {Sasha Doubov and Nikhil Sardana and Vitaliy Chiley},
journal= {arXiv preprint arXiv:2411.08968},
year = {2024}
}
备注
12 pages, 4 figures, To appear in the 4th NeurIPS Workshop on Efficient Natural Language and Speech Processing (ENLSP), 2024