扩展对抗攻击以生成对抗性类别概率分布
机器学习
2023-01-27 v3 机器学习
摘要
尽管深度学习模型在广泛的人工智能任务中表现出卓越的性能和泛化水平,但已有研究表明,这些模型只需在自然输入上添加难以察觉却恶意的扰动即可被轻易欺骗。这些被篡改的输入在文献中被称为对抗样本。在本文中,我们提出了一种新颖的概率框架,以推广并扩展对抗攻击,从而在对大量输入应用攻击方法时产生所期望的类别概率分布。这种新颖的攻击范式使攻击者对被攻击模型拥有更强的控制力,从而在多种场景下暴露出传统范式无法实施的针对深度学习模型的威胁。我们引入了四种不同的策略来高效生成此类攻击,并通过扩展多种对抗攻击算法来阐明我们的方法。我们还在语音命令分类任务和推文情感分类任务上实验验证了我们的方法,这两个分别是音频和文本领域的典型机器学习问题。我们的结果表明,我们可以在保持高欺骗率的同时紧密逼近任意类别概率分布,甚至能够阻止标签偏移检测方法检测到这些攻击。
引用
@article{arxiv.2004.06383,
title = {Extending Adversarial Attacks to Produce Adversarial Class Probability Distributions},
author = {Jon Vadillo and Roberto Santana and Jose A. Lozano},
journal= {arXiv preprint arXiv:2004.06383},
year = {2023}
}
备注
Final version as accepted in JMLR. Attribution requirements are provided at http://jmlr.org/papers/v24/21-0326.html