自然语言理解中模型蒸馏与剪枝的鲁棒性挑战
计算与语言
2023-02-28 v2 机器学习
摘要
近期工作聚焦于压缩 BERT 等预训练语言模型(PLM),其主要目标是提升下游任务的分布内性能。然而,极少有研究分析压缩对压缩模型在分布外(OOD)数据上泛化性和鲁棒性的影响。为此,我们研究了两种流行的模型压缩技术,包括知识蒸馏和剪枝,并表明尽管压缩模型在任务的分布内开发集上取得了相似性能,但在 OOD 测试集上其鲁棒性显著低于对应的 PLM。进一步分析表明,压缩模型在捷径样本上过拟合,而在困难样本上泛化性差。我们进一步利用该观察,基于样本不确定性开发了一种用于鲁棒模型压缩的正则化策略。在多个自然语言理解任务上的实验结果表明,我们的偏差缓解框架提升了压缩模型的 OOD 泛化能力,同时未牺牲分布内任务性能。
引用
@article{arxiv.2110.08419,
title = {Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding},
author = {Mengnan Du and Subhabrata Mukherjee and Yu Cheng and Milad Shokouhi and Xia Hu and Ahmed Hassan Awadallah},
journal= {arXiv preprint arXiv:2110.08419},
year = {2023}
}
备注
Accepted by EACL 2023