中文

基于生成模型动力学的通用数据净化:面向训练时投毒防御

机器学习 2024-06-04 v2 人工智能 密码学与安全

摘要

训练时数据投毒攻击通过在训练期间引入对抗性样本来威胁机器学习模型,导致误分类。当前的防御方法往往会降低泛化性能、针对特定攻击,并且施加显著的训练开销。为此,我们引入了一套通用的数据净化方法,使用随机变换 Ψ(x)\Psi(x) 实现,借助能量基模型(EBMs)的迭代 Langevin 动力学、去噪扩散概率模型(DDPMs)或两者的组合。这些方法以最小对分类器泛化产生影响的方式净化投毒数据。我们专门训练的 EBMs 和 DDPMs 在 CIFAR-10、Tiny-ImageNet 和 CINIC-10 上针对各种攻击(包括 Narcissus、Bullseye Polytope、Gradient Matching)提供了最新的防御,无需针对特定攻击或分类器获取信息。我们讨论了性能权衡,表明即使在投毒或分布迁移的生成模型训练数据上,我们的方法也始终高度有效。

关键词

引用

@article{arxiv.2405.18627,
  title  = {PureGen: Universal Data Purification for Train-Time Poison Defense via Generative Model Dynamics},
  author = {Sunay Bhat and Jeffrey Jiang and Omead Pooladzandi and Alexander Branch and Gregory Pottie},
  journal= {arXiv preprint arXiv:2405.18627},
  year   = {2024}
}