中文

走出并围绕:基于增量数据的热启动训练

计算机视觉与模式识别 2024-06-10 v1

摘要

在现实世界的深度学习应用中,数据通常以序列形式到达,例如自动驾驶领域。当新训练数据可用时,从头训练模型会消耗大量资源,无法利用已学知识。从先前训练的检查点进行热启动是保留知识并推进学习的最直观方式。然而,现有文献表明,这种热启动会损害泛化能力。本文提倡热启动但走出先前收敛点的,从而在不损害先前知识的前提下更好地适应新数据。我们提出知识整合与获取(CKCA),一种连续模型改进算法,包含两个新颖组件。首先,一种新颖的特征正则化(FeatReg),以保留和细化现有检查点中的知识;其次,我们提出自适应知识蒸馏(AdaKD),一种新颖的忘记缓解和知识传递方法。我们在 ImageNet 上使用多个训练数据分割进行测试。我们的做法在 vanilla 热启动基础上实现了最高 8.39%8.39\% 的 top1 准确率提升,并始终以显著的优势超过现有技术。

关键词

引用

@article{arxiv.2406.04484,
  title  = {Step Out and Seek Around: On Warm-Start Training with Incremental Data},
  author = {Maying Shen and Hongxu Yin and Pavlo Molchanov and Lei Mao and Jose M. Alvarez},
  journal= {arXiv preprint arXiv:2406.04484},
  year   = {2024}
}