事后反转:我们是否过早地选择了模型?
机器学习
2024-10-07 v2 人工智能
机器学习
摘要
训练好的模型通常与事后变换(如温度缩放(TS)、集成和随机权重平均(SWA))组合,以提升性能、鲁棒性、不确定性估计等。然而,这些变换通常仅在基础模型已通过标准方法最终确定后才应用。在本文中,我们通过广泛的实证研究对这一做法提出了质疑。具体而言,我们展示了一种我们称之为事后反转的现象,即在应用事后变换后,性能趋势发生了反转。这种现象在高噪声环境中尤为显著。例如,虽然基础模型在训练早期严重过拟合,但集成和SWA都偏向于训练更多轮次的基础模型。事后反转还可以防止双重下降现象的出现,并缓解基础模型中测试损失与测试误差之间的不匹配。初步分析表明,这些变换通过抑制错误标记样本的影响,利用其与干净样本在学习动态上的差异来引发反转。基于我们的发现,我们提出了事后选择,这是一种简单的技术,通过事后指标为模型开发决策(如早停、检查点保存以及更广泛的超参数选择)提供信息。我们的实验涵盖了真实的视觉、语言、表格和图数据集。在一个LLM指令微调数据集上,与朴素选择相比,事后选择带来了>1.5倍的MMLU提升。
引用
@article{arxiv.2404.07815,
title = {Post-Hoc Reversal: Are We Selecting Models Prematurely?},
author = {Rishabh Ranjan and Saurabh Garg and Mrigank Raman and Carlos Guestrin and Zachary Lipton},
journal= {arXiv preprint arXiv:2404.07815},
year = {2024}
}
备注
accepted at NeurIPS 2024; v2 adds an intuitions section