中文

自然语言理解中模型蒸馏与剪枝的鲁棒性挑战

计算与语言 2023-02-28 v2 机器学习

摘要

近期工作聚焦于压缩 BERT 等预训练语言模型(PLM),其主要目标是提升下游任务的分布内性能。然而,极少有研究分析压缩对压缩模型在分布外(OOD)数据上泛化性和鲁棒性的影响。为此,我们研究了两种流行的模型压缩技术,包括知识蒸馏和剪枝,并表明尽管压缩模型在任务的分布内开发集上取得了相似性能,但在 OOD 测试集上其鲁棒性显著低于对应的 PLM。进一步分析表明,压缩模型在捷径样本上过拟合,而在困难样本上泛化性差。我们进一步利用该观察,基于样本不确定性开发了一种用于鲁棒模型压缩的正则化策略。在多个自然语言理解任务上的实验结果表明,我们的偏差缓解框架提升了压缩模型的 OOD 泛化能力,同时未牺牲分布内任务性能。

关键词

引用

@article{arxiv.2110.08419,
  title  = {Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding},
  author = {Mengnan Du and Subhabrata Mukherjee and Yu Cheng and Milad Shokouhi and Xia Hu and Ahmed Hassan Awadallah},
  journal= {arXiv preprint arXiv:2110.08419},
  year   = {2023}
}

备注

Accepted by EACL 2023