SMILE:用于高效迁移学习的自蒸馏Mixup
机器学习
2021-03-26 v1
摘要
为提升深度学习性能,mixup被提出以迫使神经网络在训练样本之间偏好简单的线性行为。然而,对使用预训练模型的迁移学习执行mixup并不简单,具有高容量预训练模型和大全连接(FC)层的模型即使对样本-标签混合的数据也易过拟合到目标数据集。本工作中,我们提出SMILE——用于高效迁移学习的自蒸馏Mixup(Self-Distilled Mixup for EffIcient Transfer LEarning)。以混合图像为输入,SMILE正则化CNN特征提取器的输出以从输入的混合特征向量(样本到特征混合)中学习,此外还有混合标签。具体而言,SMILE引入一个从预训练模型继承的mean teacher,以自蒸馏方式提供输入样本的特征向量,并通过新颖的三重正则化器相应混合特征向量。该三重正则化器平衡特征与标签空间中的mixup效应,同时约束预训练任务中样本间的线性。我们进行了大量实验来验证SMILE带来的性能提升,对比了广泛的迁移学习算法,包括fine-tuning、L2-SP、DELTA和RIFLE,即便结合mixup策略。消融研究表明,原始样本到标签mixup策略可边际增加训练样本间的线性但缺乏泛化性,而SMILE在训练与测试数据集上均显著改善了标签与特征空间中的mixup效应。实证观察支撑了我们的设计直觉与目的。
引用
@article{arxiv.2103.13941,
title = {SMILE: Self-Distilled MIxup for Efficient Transfer LEarning},
author = {Xingjian Li and Haoyi Xiong and Chengzhong Xu and Dejing Dou},
journal= {arXiv preprint arXiv:2103.13941},
year = {2021}
}