中文

针对数据集蒸馏的后门攻击

密码学与安全 2023-01-04 v1 机器学习

摘要

数据集蒸馏已成为一种在训练机器学习模型时提升数据效率的突出技术。它将大型数据集中的知识封装进更小的合成数据集中。在该更小的蒸馏数据集上训练的模型可达到与在原始训练数据集上训练的模型相当的性能。然而,现有的数据集蒸馏技术主要致力于实现资源使用效率与模型效用之间的最佳权衡,由此引发的安全风险尚未被探索。本研究针对在图像领域中由数据集蒸馏模型蒸馏出的数据上训练的模型,实施了首个后门攻击。具体而言,我们在蒸馏过程中而非先前的所有攻击所进行的模型训练阶段,将触发器注入合成数据。我们提出了两类后门攻击,即 NAIVEATTACK 与 DOORPING。NAIVEATTACK 在初始蒸馏阶段简单地将触发器添加至原始数据,而 DOORPING 在整个蒸馏过程中迭代更新触发器。我们在多个数据集、架构及数据集蒸馏技术上进行了广泛评估。实证评估表明,NAIVEATTACK 在某些情况下取得了尚可的攻击成功率(ASR)分数,而 DOORPING 在所有情况下均达到更高的 ASR 分数(接近 1.0)。此外,我们进行了全面的消融研究以分析可能影响攻击性能的因素。最后,我们评估了多种针对我们所提后门攻击的防御机制,并表明我们的攻击可实际规避这些防御机制。

关键词

引用

@article{arxiv.2301.01197,
  title  = {Backdoor Attacks Against Dataset Distillation},
  author = {Yugeng Liu and Zheng Li and Michael Backes and Yun Shen and Yang Zhang},
  journal= {arXiv preprint arXiv:2301.01197},
  year   = {2023}
}