如何在知识蒸馏中植入后门
密码学与安全
2026-01-13 v2 人工智能
机器学习
摘要
知识蒸馏已成为现代机器学习系统的基石,因其能够将来自大型复杂教师模型的知识传递给更高效的学生模型。传统上,人们认为该过程是安全的,假设教师模型是干净的。这一信念源自传统后门攻击依赖带有后门触发器和攻击者选定标签的受毒化训练数据的假设,而这些触发器在蒸馏过程中并不参与。相反,知识蒸馏使用干净教师模型的输出来指导学生模型,从而本质上防止了学生模型识别或响应攻击者原本 intends 的后门触发器。在本文中,我们挑战了这一假设,通过引入一种新型攻击方法,策略性地将包含后门触发器的对抗性样本植入蒸馏数据集中。这种技术允许在保持教师模型完整性的前提下,窃取学生模型。我们的方法代表了首次成功利用干净教师模型中知识蒸馏过程漏洞的攻击。通过在各种数据集和攻击设置下进行大量实验,我们展示了该方法的鲁棒性、隐蔽性和有效性。我们的发现揭示了知识蒸馏过程中先前未被认识到的漏洞,为未来研究指明了Securing knowledge distillation 过程以抵御后门攻击的方向。
引用
@article{arxiv.2504.21323,
title = {How to Backdoor the Knowledge Distillation},
author = {Chen Wu and Qian Ma and Prasenjit Mitra and Sencun Zhu},
journal= {arXiv preprint arXiv:2504.21323},
year = {2026}
}