中文

XtremeDistilTransformers:用于任务无关蒸馏的任务迁移

计算与语言 2021-06-15 v2 人工智能 机器学习

摘要

尽管深度且大型的预训练模型在各种自然语言处理任务中处于最先进水平,其庞大的规模在资源受限场景的实际应用中带来了显著挑战。近期知识蒸馏方面的研究提出了任务无关及任务特定的方法来压缩这些模型,其中任务特定的方法往往获得更高的压缩率。本工作中,我们开发了新任务无关蒸馏框架XtremeDistilTransformers,其利用任务特定方法的优势来学习可应用于任意任务与语言的小型通用模型。为此,我们研究了若干源任务、增强资源及模型架构在蒸馏中的可迁移性。我们在多个任务上评估了模型性能,包括通用语言理解评估(GLUE)基准、SQuAD问答数据集以及一个含41种语言的大规模多语言命名实体识别(NER)数据集。我们发布了三个蒸馏后的任务无关检查点,参数量分别为13MM、22MM和33MM,在若干任务上取得SOTA性能。

关键词

引用

@article{arxiv.2106.04563,
  title  = {XtremeDistilTransformers: Task Transfer for Task-agnostic Distillation},
  author = {Subhabrata Mukherjee and Ahmed Hassan Awadallah and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2106.04563},
  year   = {2021}
}

备注

Code and checkpoints released (links in draft)