通过对抗训练算法的投毒攻击评估其脆弱性
密码学与安全
2023-05-02 v1
摘要
对抗训练(AT)是一种鲁棒学习算法,可防御推理阶段的对抗攻击并缓解训练阶段 corrupted 数据的副作用。因此,它已成为许多人工智能(AI)系统不可或缺的组件。然而,在高风险AI应用中,理解AT的脆弱性以确保可靠部署至关重要。本文中,我们研究AT对投毒攻击的易感性,该类恶意攻击通过操纵训练数据以破坏训练模型性能。先前工作聚焦于针对标准训练的投毒攻击,但对其针对AT有效性的研究甚少。为填补此空白,我们设计并测试了针对AT的有效投毒攻击。具体而言,我们研究并设计干净标签投毒攻击,使攻击者不可感知地修改少量训练数据以控制算法在特定目标数据点上的行为。此外,我们提出干净标签无目标攻击,使攻击者能在训练数据上附着微小贴纸以劣化算法在所有测试数据上的性能,其中贴纸可作为对抗未授权数据收集的信号。我们的实验表明AT仍可被投毒,凸显在安全相关应用中使用朴素AT算法需谨慎。代码见 https://github.com/zjfheart/Poison-adv-training.git。
引用
@article{arxiv.2305.00399,
title = {Assessing Vulnerabilities of Adversarial Learning Algorithm through Poisoning Attacks},
author = {Jingfeng Zhang and Bo Song and Bo Han and Lei Liu and Gang Niu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2305.00399},
year = {2023}
}