重新学习被遗忘的知识:关于过拟合、深度神经网络的遗忘现象与无训练集成
机器学习
2023-12-29 v2
摘要
深度神经网络中过拟合的罕见发生令人困惑。一方面,理论预测随着模型变大,它们最终应变得对特定训练集过于专门化,进而导致泛化能力下降。相反,图像分类的实证结果表明,增加深度模型的训练时间或使用更大模型几乎从不损害泛化。这是因为我们衡量过拟合的方式过于局限吗?在此,我们引入一种量化过拟合的新指标,其监测深度模型在验证数据上的遗忘率。据推测,该指标表明即使整体泛化改善,在数据空间的某些区域泛化仍会恶化。以此度量,我们展示过拟合可在验证精度下降或不下降时发生,且可能比此前所认为的更常见。该观察有助于澄清上述令人困惑的局面。我们利用观察构建了一种仅基于单一网络训练历史的新型集成方法,其在不增加任何训练时间成本下显著提升性能。对现代深度模型的广泛实证评估显示了我们的方法在多个数据集、神经网络架构和训练方案上的效用,无论从头训练还是在迁移学习中使用预训练网络。值得注意的是,我们的方法优于可比方法且更易于实现和使用,并进一步在 Imagenet 上将竞争性网络的性能提升 1%。
引用
@article{arxiv.2310.11094,
title = {Relearning Forgotten Knowledge: on Forgetting, Overfit and Training-Free Ensembles of DNNs},
author = {Uri Stern and Daphna Weinshall},
journal= {arXiv preprint arXiv:2310.11094},
year = {2023}
}