中文

暗色蒸馏:无需访问原始数据即可后门化蒸馏数据集

密码学与安全 2025-02-07 v1 人工智能

摘要

数据蒸馏(Dataset Distillation, DD)通过将大型数据集压缩为较小的合成数据集来提升训练效率并减少带宽,从而使模型能在原始完整数据集上实现相当的性能,已成为数据共享的广泛采用的方法。然而,DD 的安全性关注仍未得到充分探讨。现有研究通常假设恶意行为源自数据所有者在初始蒸馏过程中,对原始数据集注入后门。相比之下,本工作首次针对更真实且令人担忧的威胁进行研究:攻击者可能在数据分布过程中窃取数据集,注入后门并将其重新分发给用户。虽然蒸馏数据集此前被视为抗后门攻击的,但我们展示它们仍然 vulnerable 于此类攻击。此外,我们证明攻击者甚至无需访问任何原始数据即可成功注入后门。具体而言,我们的方法从在蒸馏数据集上训练的模型中重建每个类别的概念原型。随后将后门注入这些原型以更新蒸馏数据集。此外,我们确保更新后的数据集不仅保留后门,还保持原始优化轨迹,从而维持对原始数据集的知识。为实现此目标,设计了混合损失函数,将后门信息整合到良性优化轨迹中,确保以前学习的信息不会被遗忘。大量实验表明,蒸馏数据集对后门攻击极其脆弱,风险在各种原始数据集、蒸馏方法和下游训练策略之间广泛渗透。此外,我们的攻击方法高效,能够在某些情况下一分钟内合成恶意蒸馏数据集。

关键词

引用

@article{arxiv.2502.04229,
  title  = {Dark Distillation: Backdooring Distilled Datasets without Accessing Raw Data},
  author = {Ziyuan Yang and Ming Yan and Yi Zhang and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2502.04229},
  year   = {2025}
}