中文

约束深度学习模型:一种基于历史的方法以缓解过拟合

软件工程 2024-05-21 v1 人工智能

摘要

在软件工程中,深度学习模型越来越多地被部署用于错误检测和代码审查等关键任务。然而,过拟合仍然是一个挑战,它影响使用深度学习模型的软件系统的质量、可靠性和可信度。过拟合可以被(1)预防(例如,使用 dropout 或提前停止)或(2)在已训练的模型中被检测到(例如,使用基于相关性的方法)。当前使用的过拟合检测和预防方法均存在约束(例如,需要修改模型结构以及高计算资源)。在本文中,我们提出了一种简单而强大的方法,该方法基于训练历史(即验证损失)既能检测又能预防过拟合。我们的方法首先在过拟合模型的训练历史上训练一个时间序列分类器。然后使用该分类器来检测已训练的模型是否过拟合。此外,我们训练的分类器可通过确定停止模型训练的最佳点来预防过拟合。我们评估了我们的方法在真实样本中识别和预防过拟合的能力。我们将我们的方法与基于相关性的检测方法和最常用的预防方法(即提前停止)进行了比较。我们的方法达到了 0.91 的 F1 分数,比当前性能最佳的非侵入式过拟合检测方法至少高出 5%。此外,我们的方法能够比提前停止早至少 32% 的时间停止训练以避免过拟合,并且具有相同或更好的返回最佳模型的比率。

关键词

引用

@article{arxiv.2401.10359,
  title  = {Keeping Deep Learning Models in Check: A History-Based Approach to Mitigate Overfitting},
  author = {Hao Li and Gopi Krishnan Rajbahadur and Dayi Lin and Cor-Paul Bezemer and Zhen Ming and Jiang},
  journal= {arXiv preprint arXiv:2401.10359},
  year   = {2024}
}