HINT:基于健康影响噪声的训练以防御数据投毒攻击
机器学习
2023-11-23 v3 人工智能
密码学与安全
摘要
尽管已提出众多防御方法来阻止来自不可信数据源的潜在投毒攻击,大多数研究工作仅针对特定攻击进行防御,这为 adversary 留下了诸多可利用的途径。本工作中,我们提出一种基于影响函数的高效鲁棒训练方法以防御数据投毒攻击,名为 Healthy Influential-Noise based Training(HINT)。利用影响函数,我们构造健康噪声,在不显著影响测试数据泛化能力的前提下,帮助强化分类模型抵御投毒攻击。此外,我们的方法仅修改部分训练数据时即可有效运作,而非先前若干工作所使用的向所有样本添加噪声的当前方法。我们在两个图像数据集上针对 SOTA 投毒攻击、于不同现实攻击场景下进行了全面评估。我们的实证结果表明,HINT 能高效保护深度学习模型免受无目标与有目标投毒攻击的影响。
引用
@article{arxiv.2309.08549,
title = {HINT: Healthy Influential-Noise based Training to Defend against Data Poisoning Attacks},
author = {Minh-Hao Van and Alycia N. Carey and Xintao Wu},
journal= {arXiv preprint arXiv:2309.08549},
year = {2023}
}