中文

论最后一层重训练的非合理有效性

机器学习 2026-05-15 v2

摘要

最后一层重训练 (LLR) 方法——即在 ERM 训练后对神经网络的最后一层进行重新初始化并在保留集上重新训练——因其作为纠正虚假关联依赖并提高少数群体性能的高效方法而引起广泛关注。令人惊讶的是,LLR 即使保留集为训练集的非平衡子集时,也能提高最差群体准确率。我们最初假设,LLR 的这种“非合理有效性”主要归因于其通过保留集减缓神经崩溃,从而导致梯度下降的隐式偏好有助于鲁棒性。我们的经验调查并不支持这一假设。相反,我们提供了强有力的证据表明,LLR 成功的主要原因在于保留集中群体平衡性的改善。我们进一步指出,最近的算法 CB-LLR 和 AFR 通过隐式群体平衡来实现鲁棒性改进。

关键词

引用

@article{arxiv.2512.01766,
  title  = {On the Unreasonable Effectiveness of Last-layer Retraining},
  author = {John C. Hill and Tyler LaBonte and Xinchen Zhang and Vidya Muthukumar},
  journal= {arXiv preprint arXiv:2512.01766},
  year   = {2026}
}