中文

对抗代理人:基于强化学习的黑箱规避攻击

密码学与安全 2025-11-20 v2 人工智能

摘要

机器学习模型的攻击通过无状态优化方式进行了广泛研究。本文展示了强化学习 (RL) 代理人如何学习生成对抗样本的新型攻击算法。不同于传统对抗机器学习 (AML) 方法独立制造对抗样本的方式,本 RL 方法保留并利用过去攻击经验,以提高未来攻击的有效性和效率。我们将对抗样本生成形式化为马尔可夫决策过程,并评估 RL 的能力:(a) 学习有效且高效的攻击策略;(b) 与最先进的 AML 竞争。在两个图像分类基准测试中,我们的代理人将攻击成功率提高最高可达 13.2%,并将每次攻击的平均 victim 模型查询次数降低最高可达 16.9%。在与最先进图像攻击方法的对决中,本方法使对手在训练后对未见输入生成对抗样本的成功率提高 17%。从安全角度看,本工作展示了一种强大的新型攻击向量,即利用 RL 训练高效且大规模攻击 ML 模型的代理人。

关键词

引用

@article{arxiv.2503.01734,
  title  = {Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning},
  author = {Kyle Domico and Jean-Charles Noirot Ferrand and Ryan Sheatsley and Eric Pauley and Josiah Hanna and Patrick McDaniel},
  journal= {arXiv preprint arXiv:2503.01734},
  year   = {2025}
}