模型汤只需要一种配料
机器学习
2026-02-11 v1
摘要
在目标分布上对大型预训练模型进行微调通常会提高分布内(ID)准确率,但会以牺牲分布外(OOD)鲁健性为代价,因为表征会针对微调数据进行专业化。权空间集成方法,如模型汤(Model Soup),通过平均多个检查点来缓解这一效应,但计算负担沉重,需要训练和存储数十个微调模型。在本文中,我们引入一种单检查点方法——MonoSoup,它一种简单、数据自由、无需调参的后处理方法,仅使用一个检查点即可实现强大的 ID-OOD 平衡。该方法对每层的更新应用奇异值分解(SVD),将其分解为捕获任务特定适应性的高能方向和引入噪声但可能仍编码有助于鲁健性的残余信号的低能方向。MonoSoup 然后利用基于熵的有效秩自动重新加权这些分量,并通过层级系数来考虑模型的谱和几何结构。在在 ImageNet 上进行微调的 CLIP 模型以及在自然分布偏移下进行的实验中,以及在数学推理和多选基准测试中对 Qwen 语言模型的评估结果表明,该方法是一种实用的、有效的替代方案,保留了多数检查点方法的优势,而无需其计算开销。
引用
@article{arxiv.2602.09689,
title = {Model soups need only one ingredient},
author = {Alireza Abdollahpoorrostam and Nikolaos Dimitriadis and Adam Hazimeh and Pascal Frossard},
journal= {arXiv preprint arXiv:2602.09689},
year = {2026}
}