中文

重新学习被遗忘的知识:关于过拟合、深度神经网络的遗忘现象与无训练集成

机器学习 2023-12-29 v2

摘要

深度神经网络中过拟合的罕见发生令人困惑。一方面,理论预测随着模型变大,它们最终应变得对特定训练集过于专门化,进而导致泛化能力下降。相反,图像分类的实证结果表明,增加深度模型的训练时间或使用更大模型几乎从不损害泛化。这是因为我们衡量过拟合的方式过于局限吗?在此,我们引入一种量化过拟合的新指标,其监测深度模型在验证数据上的遗忘率。据推测,该指标表明即使整体泛化改善,在数据空间的某些区域泛化仍会恶化。以此度量,我们展示过拟合可在验证精度下降或不下降时发生,且可能比此前所认为的更常见。该观察有助于澄清上述令人困惑的局面。我们利用观察构建了一种仅基于单一网络训练历史的新型集成方法,其在不增加任何训练时间成本下显著提升性能。对现代深度模型的广泛实证评估显示了我们的方法在多个数据集、神经网络架构和训练方案上的效用,无论从头训练还是在迁移学习中使用预训练网络。值得注意的是,我们的方法优于可比方法且更易于实现和使用,并进一步在 Imagenet 上将竞争性网络的性能提升 1%。

关键词

引用

@article{arxiv.2310.11094,
  title  = {Relearning Forgotten Knowledge: on Forgetting, Overfit and Training-Free Ensembles of DNNs},
  author = {Uri Stern and Daphna Weinshall},
  journal= {arXiv preprint arXiv:2310.11094},
  year   = {2023}
}