博弈论不可学习样本生成器
机器学习
2024-02-01 v1 密码学与安全
机器学习
摘要
不可学习样本攻击是一种数据投毒攻击,旨在通过向训练样本添加不可察觉的扰动来降低深度学习的干净测试准确率,这可以被表述为一个双层优化问题。然而,直接求解此优化问题对于深度神经网络来说是棘手的。在本文中,我们从博弈论视角研究不可学习样本攻击,将其表述为非零和 Stackelberg 博弈。首先,证明了在正常设置和对抗训练设置下博弈均衡的存在性。结果表明,当使用特定的损失函数时,博弈均衡给出了最强有力的投毒攻击,即受害者在同一假设空间内的所有网络中具有最低的测试准确率。其次,我们提出了一种新颖的攻击方法,称为博弈不可学习样本(GUE),其具有三个主要特点。(1) 通过使用一阶算法直接求解 Stackelberg 博弈的均衡来获取投毒样本。(2) 我们采用类似自编码器的生成网络模型作为投毒攻击者。(3) 引入了一种新颖的收益函数来评估投毒的性能。大量实验表明,GUE 能够在各种场景下有效地对模型进行投毒。此外,GUE 在使用相对较小比例的训练数据来训练生成器时仍然有效,并且投毒生成器能够很好地泛化到未见数据。我们的实现代码可在 https://github.com/hong-xian/gue 获取。
引用
@article{arxiv.2401.17523,
title = {Game-Theoretic Unlearnable Example Generator},
author = {Shuang Liu and Yihan Wang and Xiao-Shan Gao},
journal= {arXiv preprint arXiv:2401.17523},
year = {2024}
}