教会得学的病:面向蒸馏条件后门攻击的探索
密码学与安全
2025-09-30 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
知识蒸馏 (KD) 是将知识从大型教师模型转移到轻量级学生模型,以在资源受限设备上部署深度神经网络 (DNN) 的关键技术。虽然来自第三方平台的教师模型可能经过安全验证(如后门检测),但我们发现了一种新型且关键威胁:蒸馏条件后门攻击 (DCBA)。DCBA 将潜伏且不可检测的后门注入教师模型,这些后门通过 KD process 在学生模型中激活,即使使用干净的蒸馏数据集亦是如此。虽然现有方法的直接延伸对 DCBA 效果不佳,但我们通过将其形式化为双层优化问题并提出一种简单而有效的方法(即 SCAR)来实现此攻击。具体而言,内层优化通过优化代理学生模型来模拟 KD 流程,而外层优化则利用该代理的输出来优化教师模型,以植入条件后门。我们的 SCAR 通过一种带预优化触发器注入函数的隐式微分算法来处理这一复杂优化。广泛的实验在多样化的数据集、模型架构和 KD 技术上验证了 SCAR 的有效性及其对现有后门检测的抗性,凸显了 KD 流程中一个显著且此前被忽视的漏洞。我们的代码已公开于 https://github.com/WhitolfChen/SCAR。
引用
@article{arxiv.2509.23871,
title = {Taught Well Learned Ill: Towards Distillation-conditional Backdoor Attack},
author = {Yukun Chen and Boheng Li and Yu Yuan and Leyi Qi and Yiming Li and Tianwei Zhang and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2509.23871},
year = {2025}
}
备注
The first three authors contributed equally to this work. To appear in NeurIPS 2025. 35 pages