SADT:将锐度感知最小化与自蒸馏结合以提升模型泛化能力
机器学习
2022-11-02 v1
摘要
用于改进深度神经网络训练时间与模型泛化能力的方法包含多种数据增强、正则化和优化策略,这些方法往往对超参数设置敏感,并使可复现性更具挑战性。本工作联合考虑了两种近期解决模型泛化能力的训练策略:锐度感知最小化与自蒸馏,并提出了一种新颖的训练策略——锐度感知蒸馏教师(SADT)。本工作的实验部分表明,在各种神经架构、数据集和超参数设置下,SADT 在模型收敛时间、测试时性能与模型泛化能力上持续优于先前已发表的培训策略。
引用
@article{arxiv.2211.00310,
title = {SADT: Combining Sharpness-Aware Minimization with Self-Distillation for Improved Model Generalization},
author = {Masud An-Nur Islam Fahim and Jani Boutellier},
journal= {arXiv preprint arXiv:2211.00310},
year = {2022}
}
备注
Accepted to the "Has it Trained Yet?" Workshop at the Conference on Neural Information Processing Systems (NeurIPS 2022)