中文

重新审视带毒教师的数据无关知识蒸馏

机器学习 2023-06-06 v1 密码学与安全

摘要

数据无关知识蒸馏(KD)可在无需访问用于训练教师模型的原始训练数据的情况下,将知识从预训练模型(称为教师模型)迁移到更小的模型(称为学生模型)。然而,数据无关 KD 所需的合成或分布外(OOD)数据的安全性在很大程度上未知且未被充分探索。本工作中,我们首次致力于揭示数据无关 KD 相对于不可信预训练模型的安全风险。随后我们提出抗后门数据无关 KD (ABD),这是首个用于数据无关 KD 方法的插件式防御方法,以降低潜在后门被迁移的可能性。我们通过实验评估了所提 ABD 在削弱被迁移后门知识的同时保持与原始 KD 相兼容的下游性能方面的有效性。我们视本工作为警示并缓解数据无关 KD 中潜在后门的里程碑。代码发布于 https://github.com/illidanlab/ABD。

关键词

引用

@article{arxiv.2306.02368,
  title  = {Revisiting Data-Free Knowledge Distillation with Poisoned Teachers},
  author = {Junyuan Hong and Yi Zeng and Shuyang Yu and Lingjuan Lyu and Ruoxi Jia and Jiayu Zhou},
  journal= {arXiv preprint arXiv:2306.02368},
  year   = {2023}
}

备注

Accepted to ICML 2023