用于 Transformer 进一步预训练的自蒸馏方法
计算机视觉与模式识别
2023-06-12 v3 机器学习
摘要
在大量无标注数据上预训练大型 transformer 模型,并在标注数据集上针对多样下游任务进行微调,已被证明是视觉与自然语言处理多种任务的成功策略。然而,若预训练与微调的数据域之间存在较大差异,直接微调预训练模型可能并非最优。为解决此问题,若干先前研究提出了进一步预训练策略,即在微调前继续在目标无标注数据集上预训练模型。然而,它们均仅关注语言模型,且我们通过实证发现,当我们继续在目标无标注数据上预训练 Vision Transformer 时,其易受过拟合影响。为应对该局限,我们提出将自蒸馏作为进一步预训练阶段的正则化方法。具体而言,我们首先在目标无标注数据上进一步预训练初始预训练模型,并将其视为用于自蒸馏的教师模型。然后我们取相同的初始预训练模型作为学生,并在以掩码自编码目标优化学生的同时,强制其隐藏表示接近教师的隐藏表示。我们在图像与文本分类任务的多种基准数据集上实证验证了自蒸馏的有效性。实验上,我们表明所提方法优于所有相关基线。理论上,我们用一个简化模型分析所提方法,以理解用于进一步预训练的自蒸馏如何潜在地帮助提升下游任务性能。
引用
@article{arxiv.2210.02871,
title = {Self-Distillation for Further Pre-training of Transformers},
author = {Seanie Lee and Minki Kang and Juho Lee and Sung Ju Hwang and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2210.02871},
year = {2023}
}
备注
ICLR 2023