DAFT:蒸馏对抗微调模型以提升分布外泛化能力
机器学习
2022-08-22 v1
摘要
我们考虑OOD(分布外)泛化问题,其目标是训练一个在不同于训练分布的测试分布上表现良好的模型。深度学习模型已知对此类分布偏移十分脆弱,即便测试分布仅有微小差异也可能出现大幅准确率下降。我们提出一种基于如下直觉的新方法——DAFT:大量丰富特征的对抗鲁棒组合应能提供OOD鲁棒性。我们的方法精心地从强大的教师模型中蒸馏知识,该教师模型通过标准训练学习多个判别性特征,并通过对抗训练将其组合。标准对抗训练过程被修改以产生能更好指导学生模型的教师。我们在DomainBed框架下的标准基准上评估DAFT,并证明DAFT相较当前SOTA的OOD泛化方法取得显著提升。DAFT以更小的网络尤为明显的增益,持续优于充分调优的ERM和蒸馏基线达6%。
引用
@article{arxiv.2208.09139,
title = {DAFT: Distilling Adversarially Fine-tuned Models for Better OOD Generalization},
author = {Anshul Nasery and Sravanti Addepalli and Praneeth Netrapalli and Prateek Jain},
journal= {arXiv preprint arXiv:2208.09139},
year = {2022}
}