在早期层中采用模拟退火可带来更好的泛化
机器学习
2023-04-12 v1 计算机视觉与模式识别
摘要
近来,人们引入了许多迭代学习方法来改善泛化。这些方法通常依靠更长的训练时间以换取泛化提升。LLF(后层遗忘)是此类方法中最为先进的。它通过周期性地重新初始化网络的最后几层来加强早期层的学习。我们本工作的核心创新是使用网络早期层中的模拟退火(SEAL)替代后层的重新初始化。本质上,后层经历正常的梯度下降过程,而早期层经历短时的梯度上升继以梯度下降。在流行的 Tiny-ImageNet 数据集基准以及一系列迁移学习和少样本学习任务上的大量实验表明,我们以显著优势优于 LLF。我们进一步表明,与正常训练相比,LLF 特征虽在目标任务上有所改善,但在我们所探索的所有数据集上均降低了迁移学习性能。相比之下,我们的方法在相同的目标数据集上以大幅优势超越 LLF。我们还表明,我们方法的预测深度显著低于 LLF 与正常训练,表明平均上具有更好的预测性能。
引用
@article{arxiv.2304.04858,
title = {Simulated Annealing in Early Layers Leads to Better Generalization},
author = {Amirmohammad Sarfi and Zahra Karimpour and Muawiz Chaudhary and Nasir M. Khalid and Mirco Ravanelli and Sudhir Mudur and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2304.04858},
year = {2023}
}