Model-GLUE:野外大规模模型囊庞的民主化 LLM 扩展指南
机器学习
2024-12-06 v2 人工智能
计算与语言
摘要
随着大型语言模型(LLM)在各类任务和专业领域中表现卓越,基于现有模型进行LLM扩展受到广泛关注,这面临着当组合异构模型时性能下降的挑战。已提出各种技术用于预训练LLM的聚合,包括模型合并、Mixture-of-Experts和堆叠。尽管这些方法各有优势,但针对多样化模型囊庞的全面比较和协同应用尚不充分。针对这一研究空白,本文引入Model-GLUE,一个综合性的LLM扩展指南。首先,我们对现有LLM扩展技术进行基准测试,尤其是选择性合并和混合的变体。利用基准结果所获得的洞见,我们制定了针对不同架构和初始化的异构模型囊庞进行选择和聚合的最优策略。我们的 methodology 包括对可合并模型的聚类、最优合并策略选择,以及通过模型混合整合聚类。最终,基于在多样化的Llama-2模型囊庞上的实验,Model-GLUE实现了平均5.61%的性能提升,且无需额外训练。代码已公开:https://github.com/Model-GLUE/Model-GLUE。
引用
@article{arxiv.2410.05357,
title = {Model-GLUE: Democratized LLM Scaling for A Large Model Zoo in the Wild},
author = {Xinyu Zhao and Guoheng Sun and Ruisi Cai and Yukun Zhou and Pingzhi Li and Peihao Wang and Bowen Tan and Yexiao He and Li Chen and Yi Liang and Beidi Chen and Binhang Yuan and Hongyi Wang and Ang Li and Zhangyang Wang and Tianlong Chen},
journal= {arXiv preprint arXiv:2410.05357},
year = {2024}
}
备注
24 pages, 4 figures, accepted to NeurIPS 2024 Datasets and Benchmarks Track