PureEBM: 基于能量基模型中期动力学的通用毒气净化
机器学习
2024-06-04 v2 人工智能
摘要
数据毒化攻击通过在训练期注入对抗性示例而威胁机器学习模型的完整性,导致目标分布数据的误分类。现有最先进(SoTA)防御方法存在诸多局限,如显著降低泛化性能以及在训练期间产生显著开销,使其在实际应用中不够实用或受限。针对这一挑战,我们引入一种通用的数据净化方法,可自然训练的分类器抵御恶意的白色、灰色和黑色图像毒气,通过对初始化为图像x的能量基模型(EBM)进行迭代朗兰姆采样来实现通用随机预处理步骤ΨT(x)。ΨT(x)的中期动力学以最小影响分类器网络对泛化至关重要的特征的方式净化毒气信息。我们表明,即使在毒化的EBM训练数据存在时,EBM仍是通用净化器,并在领先的触发型和非触发型毒气上实现了SoTA防御。本工作是更大框架的一部分,见\pgen,本文更详细地关注EBM净化和毒气防御。
引用
@article{arxiv.2405.19376,
title = {PureEBM: Universal Poison Purification via Mid-Run Dynamics of Energy-Based Models},
author = {Omead Pooladzandi and Jeffrey Jiang and Sunay Bhat and Gregory Pottie},
journal= {arXiv preprint arXiv:2405.19376},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2405.18627