若不能用,则回收利用:优化大规模合并可缓解性能权衡
计算与语言
2025-02-05 v3 人工智能
摘要
模型合并已在组合专家模型方面展现出巨大潜力,但当合并的是在多个任务上训练的“通才”模型时,合并的益处尚不明确。我们通过回收在不同任务间表现出权衡的检查点,探索了大规模(约1000亿参数)模型背景下的合并。此类检查点通常在开发前沿模型的过程中产生,次优的检查点通常会被丢弃。给定一个从不同训练运行(例如,不同阶段、目标、超参数和数据混合)获得的模型检查点池,这些检查点自然地在不同语言能力(例如,指令遵循与代码生成)上表现出权衡,我们研究合并是否能将这些次优模型回收为一个帕累托最优模型。我们的优化算法调整线性组合中每个检查点的权重,从而产生这样一个最优模型,其性能优于单个模型和基于合并的基线。进一步分析表明,好的合并倾向于包含几乎所有具有非零权重的检查点,这表明即使看似糟糕的初始检查点也能对良好的最终合并有所贡献。
引用
@article{arxiv.2412.04144,
title = {If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs},
author = {Muhammad Khalifa and Yi-Chern Tan and Arash Ahmadian and Tom Hosking and Honglak Lee and Lu Wang and Ahmet Üstün and Tom Sherborne and Matthias Gallé},
journal= {arXiv preprint arXiv:2412.04144},
year = {2025}
}
备注
13 pages, 9 figures