INK:针对模型蒸馏的可继承自然后门攻击
密码学与安全
2024-09-10 v3 人工智能
计算机视觉与模式识别
摘要
深度学习模型易受后门攻击,攻击者通过数据投毒注入恶意行为,随后利用触发器操纵已部署的模型。为提高后门的隐蔽性和有效性,已有研究引入了各种针对防御机制和人工审查的不可感知攻击方法。然而,所有基于投毒的攻击仍依赖于对训练数据集的特权访问。因此,使用可信数据集进行模型蒸馏已成为抵御这些攻击的有效防御手段。为弥补这一缺口,我们提出 INK,一种针对模型蒸馏的可继承自然后门攻击。INK 的核心思路是利用所有数据集中自然存在的统计特征,使攻击者无需直接访问训练数据即可将其作为后门触发器。具体而言,INK 以图像方差作为后门触发器,并通过操纵未认证数据集中的标签和图像方差实现干净图像与干净标签攻击。一旦后门被嵌入,即使防御者使用可信数据集进行蒸馏,它也会从教师模型迁移到学生模型。理论分析与实验结果表明,INK 对基于变换、基于搜索和基于蒸馏的防御均具有鲁棒性。例如,蒸馏后 INK 保持超过 98\% 的攻击成功率,而现有方法平均成功率仅为 1.4\%。
引用
@article{arxiv.2304.10985,
title = {INK: Inheritable Natural Backdoor Attack Against Model Distillation},
author = {Xiaolei Liu and Ming Yi and Kangyi Ding and Bangzhou Xin and Yixiao Xu and Li Yan and Chao Shen},
journal= {arXiv preprint arXiv:2304.10985},
year = {2024}
}
备注
11 pages, 9 figures