中文

AutoDistil:用于蒸馏大语言模型的少样本任务无关神经架构搜索

计算与语言 2022-02-22 v2

摘要

知识蒸馏(KD)方法在给定预指定计算代价下,通过人工设计的学生架构将大模型压缩为更小的学生模型。这需要多次尝试才能找到可行学生,且每更换学生或计算预算都需重复该过程。我们利用神经架构搜索(NAS)从大模型中自动蒸馏出多个具有可变代价的压缩学生。现有工作训练一个由数百万个子网络组成的 SuperLM 并共享权重,导致不同规模子网络间的相互干扰。我们的框架 AutoDistil 通过以下步骤应对上述挑战:(a)引入归纳偏置与启发式方法,将 Transformer 搜索空间划分为 K 个紧凑子空间(针对 base、small 和 tiny 典型学生规模取 K=3);(b)利用任务无关目标(如自注意力蒸馏)通过学生权重共享为每个子空间训练一个 SuperLM;(c)无需重训练的轻量级最优学生搜索。完全任务无关的的训练与搜索使学生可复用于任意下游任务的微调。在 GLUE 基准上与最先进的 KD 和 NAS 方法的实验表明,AutoDistil 以最高 2.7 倍的计算代价降低和可忽略的任务性能损失优于主流压缩技术。

关键词

引用

@article{arxiv.2201.12507,
  title  = {AutoDistil: Few-shot Task-agnostic Neural Architecture Search for Distilling Large Language Models},
  author = {Dongkuan Xu and Subhabrata Mukherjee and Xiaodong Liu and Debadeepta Dey and Wenhui Wang and Xiang Zhang and Ahmed Hassan Awadallah and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2201.12507},
  year   = {2022}
}

备注

15 pages, 4 figures, 10 tables