学生是否像教师一样会进行去偏?知识蒸馏中偏差缓解方法的可提炼性研究
机器学习
2025-10-31 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
知识蒸馏(KD)是模型压缩和知识在模型之间传递的有效方法,但其对模型对虚假关联的鲁棒性——这些关联会降低在分布外数据上的性能——的影响仍未得到充分探索。本研究 investigates 知识蒸馏对自然语言推理(NLI)和图像分类任务上“去偏”能力从教师模型传递到学生模型的可提炼性。通过大量实验,我们揭示了几个关键发现:(i)总体而言,模型的去偏能力在KD后受到削弱;(ii)训练去偏模型不会因注入教师知识而受益;(iii)虽然模型的总体鲁棒性可能在蒸馏后保持稳定,但不同类型的偏差会出现显著变化;(iv)我们指出了导致蒸馏后行为差异的内部注意力模式和电路。基于上述发现,我们提出三种有效解决方案来提高去偏方法的可提炼性:开发高质量数据进行增强、实施迭代知识蒸馏、以及初始化学生模型以使用来自教师模型的权重。据我们了解,这是首个大规模研究KD对去偏及其内部机制的影响。我们的发现提供了理解KD工作方式以及如何设计更好去偏方法的理解。
引用
@article{arxiv.2510.26038,
title = {Do Students Debias Like Teachers? On the Distillability of Bias Mitigation Methods},
author = {Jiali Cheng and Chirag Agarwal and Hadi Amiri},
journal= {arXiv preprint arXiv:2510.26038},
year = {2025}
}