面向组偏移的分布鲁棒神经网络:正则化对最坏情况泛化的重要性
机器学习
2020-04-03 v2 机器学习
摘要
过度参数化神经网络在独立同分布测试集上平均而言可高度准确,却持续在数据的非典型组上失败(例如通过学习平均成立但在这些组中不成立的伪相关)。分布鲁棒优化(DRO)允许我们学习这样的模型:其最小化在一组预定义组上的最坏情况训练损失。然而,我们发现将组 DRO 朴素地应用于过度参数化神经网络会失败:这些模型可完美拟合训练数据,且任何具有消失平均训练损失的模型也已具有消失的最坏情况训练损失。相反,糟糕的最坏情况性能源于某些组上糟糕的泛化。通过将组 DRO 模型与增强的正则化——强于典型的 L2 惩罚或早停——相结合,我们实现了显著更高的worst-group准确率,在自然语言推理任务和两项图像任务上取得 10-40 个百分点的提升,同时保持高平均准确率。我们的结果表明,在过度参数化情形下,正则化对于最坏组泛化是重要的,即便平均泛化并不需要它。最后,我们引入了一种具有收敛保证的随机优化算法,以高效训练组 DRO 模型。
引用
@article{arxiv.1911.08731,
title = {Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization},
author = {Shiori Sagawa and Pang Wei Koh and Tatsunori B. Hashimoto and Percy Liang},
journal= {arXiv preprint arXiv:1911.08731},
year = {2020}
}