恶性过拟合:插值可证明地阻碍不变性
机器学习
2024-07-04 v2 机器学习
摘要
习得的分类器通常应具备某些不变性属性,以促进公平性、鲁棒性或分布外泛化。然而,近期多项工作通过实验证明,在过参数化机制下(即分类器完美拟合(插值)训练数据),常用的不变性诱导正则化器是无效的。这表明“良性过拟合”现象(模型尽管插值但泛化良好)可能无法有利地扩展到期望鲁棒性或公平性的场景。在本工作中,我们为这些观察提供了理论依据。我们证明——即使在最简单的设定下——任何插值学习规则(具有任意小的间隔)都将无法满足这些不变性属性。然后,我们提出并分析了一种算法,该算法在相同设定下成功学习到一个可证明具有不变性的非插值分类器。我们在模拟数据和 Waterbirds 数据集上验证了我们的理论观察。
引用
@article{arxiv.2211.15724,
title = {Malign Overfitting: Interpolation Can Provably Preclude Invariance},
author = {Yoav Wald and Gal Yona and Uri Shalit and Yair Carmon},
journal= {arXiv preprint arXiv:2211.15724},
year = {2024}
}