用于文本分类的对抗自监督无数据蒸馏
计算与语言
2020-10-13 v1 人工智能
摘要
大型预训练基于 transformer 的语言模型在广泛的 NLP 任务上取得了令人印象深刻的成果。过去几年中,知识蒸馏(KD)已成为将计算昂贵的模型压缩为资源高效的轻量模型的主流范式。然而,大多数 KD 算法,尤其在 NLP 中,依赖于原始训练数据集的可获得性,而由于隐私问题该数据集可能不可用。为解决这个问题,我们提出一种新颖的两阶段无数据蒸馏方法,称为对抗自监督无数据蒸馏(AS-DFD),其专为压缩大规模基于 transformer 的模型(如 BERT)而设计。为避免离散空间中的文本生成,我们引入即插即用嵌入猜测方法,从教师模型的隐藏知识中构造伪嵌入。同时,借助自监督模块量化学生模型的能力,我们以对抗训练方式调节伪嵌入的难度。据我们所知,我们的框架是为 NLP 任务设计的首个无数据蒸馏框架。我们在多个文本分类数据集上验证了方法的有效性。
引用
@article{arxiv.2010.04883,
title = {Adversarial Self-Supervised Data-Free Distillation for Text Classification},
author = {Xinyin Ma and Yongliang Shen and Gongfan Fang and Chen Chen and Chenghao Jia and Weiming Lu},
journal= {arXiv preprint arXiv:2010.04883},
year = {2020}
}
备注
11 pages, 5 figures, Accepted to EMNLP2020