中文

基于文本到文本迁移的无数据语言模型蒸馏

计算与语言 2023-11-06 v1 人工智能

摘要

当原始训练数据不可用时,无数据知识蒸馏(DFKD)在压缩模型中起着至关重要的作用。此前 NLP 中 DFKD 的工作主要聚焦于在分类任务上蒸馏如 BERT 之类的仅编码器结构,忽视了生成式语言建模的显著进展。本工作中,我们提出一种新颖的 DFKD 框架,即 DFKD-T3^{3},其中预训练生成式语言模型亦可充当用于模型压缩的可控数据生成器。这一新颖框架 DFKD-T3^{3} 构建了一个端到端可学习的文本到文本框架,将通用领域语料转换为利于压缩的任务数据,旨在提升其\textit{特异性}与\textit{多样性}。大量实验表明,我们的方法可在情感分析、语言可接受性与信息抽取等多种下游任务中提升蒸馏性能。此外,我们展示了所生成文本可直接用于蒸馏其他语言模型并优于 SOTA 方法,使我们的方法在通用 DFKD 设定中更具吸引力。我们的代码见 https://gitee.com/mindspore/models/tree/master/research/nlp/DFKD\_T3。

关键词

引用

@article{arxiv.2311.01689,
  title  = {Data-Free Distillation of Language Model by Text-to-Text Transfer},
  author = {Zheyuan Bai and Xinduo Liu and Hailin Hu and Tianyu Guo and Qinghua Zhang and Yunhe Wang},
  journal= {arXiv preprint arXiv:2311.01689},
  year   = {2023}
}