幻象攻击:信息论可检测性在对抗攻击中的关键作用
人工智能
2024-05-07 v5
摘要
部署在现实世界中的自主智能体需要对感官输入上的对抗攻击具有鲁棒性。使智能体策略鲁棒化需要预见可能的最强攻击。我们证明,现有的对强化学习智能体的观测空间攻击存在一个共同弱点:虽然有效,但其缺乏信息论可检测性约束,使得它们可通过自动化手段或人工检查被检测出来。可检测性对于对手是不利的,因为它可能触发安全升级。我们引入 {\epsilon}-illusory,一种针对序列决策者的新型对抗攻击形式,其既有效又具有 {\epsilon} 有界的统计可检测性。我们提出一种新颖的对偶上升算法来端到端地学习此类攻击。与现有攻击相比,我们通过实验发现 {\epsilon}-illusory 用自动化方法显著更难检测,且一项针对人类参与者(IRB 批准号 R84123/RE001)的小型研究表明它们对人类同样更难检测。我们的发现表明需要更好的异常检测器,以及有效的硬件和系统级防御。项目网站位于 https://tinyurl.com/illusory-attacks。
引用
@article{arxiv.2207.10170,
title = {Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks},
author = {Tim Franzmeyer and Stephen McAleer and João F. Henriques and Jakob N. Foerster and Philip H. S. Torr and Adel Bibi and Christian Schroeder de Witt},
journal= {arXiv preprint arXiv:2207.10170},
year = {2024}
}
备注
ICLR 2024 Spotlight (top 5%)