中文

不可蒸馏:构造一个无法教会学生的恶意教师模型

机器学习 2021-05-18 v1 密码学与安全

摘要

知识蒸馏(KD)是一种广泛用于将从预训练教师模型学到的知识迁移到(通常更轻量的)学生模型的技术。然而在某些情况下,该技术更像是诅咒而非福音。例如,KD 带来了暴露知识产权(IP)的潜在风险:即便一个训练好的机器学习模型以“黑盒”形式发布(例如作为可执行软件或 API 而不开源代码),仍可通过模仿输入输出行为被 KD 复制。为防止 KD 的这一不期望效应,本文引入并研究了一种称为恶意教师(Nasty Teacher)的概念:一种经特殊训练的教师网络,其性能与正常教师几乎相同,但会显著降低通过模仿它而学到的学生模型的性能。我们提出了一种简单而有效的构建恶意教师的算法,称为自我破坏知识蒸馏。具体而言,我们旨在最大化恶意教师与正常预训练网络输出之间的差异。在多个数据集上的大量实验表明,我们的方法在标准 KD 和无数据 KD 上均有效,首次为模型所有者提供了所期望的 KD 免疫能力。我们希望这一初步研究能引起更多对这类兼具社会与法律重要性的新实际问题的关注与兴趣。

关键词

引用

@article{arxiv.2105.07381,
  title  = {Undistillable: Making A Nasty Teacher That CANNOT teach students},
  author = {Haoyu Ma and Tianlong Chen and Ting-Kuei Hu and Chenyu You and Xiaohui Xie and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2105.07381},
  year   = {2021}
}

备注

ICLR 2021(Spotlight). Code is available at https://github.com/VITA-Group/Nasty-Teacher