中文

模型汤:平均多个微调模型的权重可提升精度且不增加推理时间

机器学习 2022-07-05 v3 计算与语言 计算机视觉与模式识别

摘要

最大化模型精度的常规做法是(1)以各种超参数训练多个模型,以及(2)在留出验证集上挑选表现最佳的单个模型,丢弃其余。本文在大预训练模型微调的背景下重审该流程的第二步,其中微调模型常看似位于单一低误差盆地中。我们表明,平均多个以不同超参数配置微调的模型的权重常能提升精度与鲁棒性。不同于常规集成,我们可以平均许多模型而不产生任何额外的推理或内存成本——我们称结果为“模型汤”。当微调 CLIP、ALIGN 以及在 JFT 上预训练的 ViT-G 等大型预训练模型时,我们的汤配方在 ImageNet 上的超参数扫描中相较最佳模型提供了显著提升。所得的 ViT-G 模型在 ImageNet 上达到了 90.94% 的 top-1 精度,刷新了 state of the art。此外,我们展示了模型汤方法可拓展至多个图像分类与自然语言处理任务,改善分布外性能,并提升在新下游任务上的零样本性能。最后,我们从解析上将对权重平均与 logit 集成的性能相似性关联到损失的平坦度与预测置信度,并经验地验证了该关系。代码见 https://github.com/mlfoundations/model-soups。

关键词

引用

@article{arxiv.2203.05482,
  title  = {Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time},
  author = {Mitchell Wortsman and Gabriel Ilharco and Samir Yitzhak Gadre and Rebecca Roelofs and Raphael Gontijo-Lopes and Ari S. Morcos and Hongseok Namkoong and Ali Farhadi and Yair Carmon and Simon Kornblith and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2203.05482},
  year   = {2022}
}

备注

ICML 2022. The last three authors contributed equally