中文

少即是多:过度训练的专家会损害模型的向上循环效果

机器学习 2025-06-18 v1 人工智能

摘要

现代深度学习日益依赖于可在特定数据集上进行微调的开源基础模型,这导致专家模型和适配器的数量激增,常通过 HuggingFace 和 AdapterHub 等平台共享。为利用这些资源,出现了诸多模型向上循环方法,使精调后模型能在多任务系统中重用。因此形成了一个自然的管道,旨在发挥迁移学习的优势并 amortized 既得训练成本:模型在通用数据上预训练,在特定任务上微调,然后向上循环以构建更通用的系统。一个普遍假设是,该管道各阶段的改进会向下传递,导致后续步骤获得收益。本文通过考察专家微调如何影响模型向上循环,挑战了这一假设。我们展示,针对其单个性能进行长时间微调的专家,会导致合并性能下降,无论是完全微调模型还是 LoRA 适配模型,以及当 LoRA 适配器向上循环到混合专家层时会导致下游结果更差。我们将这种退化归因于记忆一小组在晚期微调步骤中占主导地位的困难样本,这些样本在合并过程中被遗忘。最后,我们证明,基于任务的积极提前停止策略可显著改善向上循环性能。

关键词

引用

@article{arxiv.2506.14126,
  title  = {Less is More: Undertraining Experts Improves Model Upcycling},
  author = {Stefan Horoi and Guy Wolf and Eugene Belilovsky and Gintare Karolina Dziugaite},
  journal= {arXiv preprint arXiv:2506.14126},
  year   = {2025}
}