基于对抗性 inception 后门攻击的强化学习
机器学习
2025-06-04 v3 密码学与安全
摘要
近期研究表明,深度强化学习(DRL)算法在训练时易受到后门中毒攻击的威胁。这些攻击的目标有两个:在部署时观察到固定触发器时诱导预先确定的、对抗性的行为;同时在训练期间允许 agent 解决其原本任务。先前的攻击假设对 agent 的奖励拥有任意控制权,导致诱导的值远超环境的自然约束,从而产生脆弱的攻击,一旦施加适当的奖励约束便会失败。因此,本文提出了一种新的后门攻击类别,这类攻击是首次在严格奖励约束下实现 state of the art performance的。这种“inception”攻击通过操控 agent 的训练数据——将触发器插入先前观察中,并用目标对抗行为的高回报动作取代其中。我们正式定义了这些攻击,并证明它们在任意马尔可夫决策过程(MDP)中实现双重目标。基于该框架,我们设计了一种在线 inception 攻击,在受约束奖励下对多个环境实现 100% 的攻击成功率,同时最小化对 agent 任务性能的影响。
引用
@article{arxiv.2410.13995,
title = {Adversarial Inception Backdoor Attacks against Reinforcement Learning},
author = {Ethan Rathbun and Alina Oprea and Christopher Amato},
journal= {arXiv preprint arXiv:2410.13995},
year = {2025}
}
备注
9 pages, 6 figures, ICML 2025