在达到零训练误差后我们还需要零训练损失吗?
机器学习
2021-04-01 v2 机器学习
摘要
过参数化深度网络具有以零训练误差记忆训练数据的能力。即使在记忆之后,训练损失仍继续趋近于零,使模型过度自信并导致测试性能下降。由于现有正则化器并不直接旨在避免零训练损失,很难调整其超参数以维持固定/预设水平的训练损失。我们提出了一种称为淹没(flooding)的直接解决方案,当训练损失达到一个合理的小值时(我们称之为淹没水平(flood level))有意阻止其进一步减小。我们的方法通过如常进行小批量梯度下降、但在训练损失低于淹没水平时进行梯度上升,使损失围绕淹没水平浮动。这可用一行代码实现,并且与任何随机优化器及其他正则化器兼容。借助淹没,模型将以相同的非零训练损失继续“随机游走”,我们期望其漂入具有平坦损失景观的区域,从而获得更好的泛化能力。我们通过实验表明淹没提升了性能,并且作为副产品诱导了测试损失的双下降曲线。
引用
@article{arxiv.2002.08709,
title = {Do We Need Zero Training Loss After Achieving Zero Training Error?},
author = {Takashi Ishida and Ikko Yamane and Tomoya Sakai and Gang Niu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2002.08709},
year = {2021}
}
备注
ICML 2020 camera ready version