中文

RoSearch:在蒸馏预训练语言模型时搜索鲁棒学生架构

计算与语言 2021-06-08 v1 人工智能 机器学习

摘要

预训练语言模型在自然语言处理任务中取得了卓越性能。为降低预训练语言模型沉重的计算与存储需求,已有多种知识蒸馏方法被提出。然而,根据我们的观察,经知识蒸馏获得的学生模型易受到对抗攻击,这限制了其在安全敏感场景中的使用。为克服这些安全问题,本文提出 RoSearch 这一综合框架,在进行知识蒸馏时搜索具有更好对抗鲁棒性的学生模型。我们构建了基于有向无环图的搜索空间,并利用进化搜索策略来引导搜索过程。每个被搜索出的架构都在预训练语言模型上通过知识蒸馏进行训练,然后在兼顾鲁棒性、准确率和效率的指标下作为环境适应度进行评估。实验结果表明,RoSearch 在不同数据集上可将学生模型的鲁棒性从 7%~18% 提升至 45.8%~47.8%,其权重量化压缩比与现有蒸馏方法相当(相较教师模型 BERT_BASE 有 4.6×\times~6.5×\times 的提升)且准确率下降较低。此外,我们通过已搜索模型的统计总结了学生架构与鲁棒性之间的关系。

关键词

引用

@article{arxiv.2106.03613,
  title  = {RoSearch: Search for Robust Student Architectures When Distilling Pre-trained Language Models},
  author = {Xin Guo and Jianlei Yang and Haoyi Zhou and Xucheng Ye and Jianxin Li},
  journal= {arXiv preprint arXiv:2106.03613},
  year   = {2021}
}

备注

10 pages, 9 figures