CILDA:基于中间层知识蒸馏的对比数据增强
计算与语言
2022-04-19 v1
摘要
知识蒸馏(KD)是一种压缩大规模预训练语言模型的高效框架。近年来,旨在利用对比学习、中间层蒸馏、数据增强与对抗训练来改进 KD 的研究激增。在本工作中,我们提出了一种为知识蒸馏量身定制的基于学习的数据增强技术,称为 CILDA。据我们所知,这是首次将主任务的中间层表示用于提升增强样本的质量。更确切地说,我们引入了一种基于中间层匹配并使用对比损失来改进掩码对抗数据增强的 KD 增强技术。CILDA 在 GLUE 基准以及域外评估中均优于现有的 SOTA KD 方法。
引用
@article{arxiv.2204.07674,
title = {CILDA: Contrastive Data Augmentation using Intermediate Layer Knowledge Distillation},
author = {Md Akmal Haidar and Mehdi Rezagholizadeh and Abbas Ghaddar and Khalil Bibi and Philippe Langlais and Pascal Poupart},
journal= {arXiv preprint arXiv:2204.07674},
year = {2022}
}