狐入鸡舍:针对强化学习的供应链后门攻击
机器学习
2025-05-27 v1
摘要
当前针对强化学习(RL)的最先进后门攻击依赖于不切实际的宽松访问模型,这些模型假设攻击者可以读取(甚至写入)受害者的策略参数、观测或奖励。在这项工作中,我们质疑发起针对 RL 的后门攻击是否需要如此强的假设。为了回答这个问题,我们提出了供应链后门(SCAB)攻击,该攻击针对常见的 RL 工作流:使用单独提供或嵌入环境中的外部智能体来训练智能体。与先前的工作相比,我们的攻击仅依赖于 RL 智能体与所提供智能体之间的合法交互。尽管访问模型受限,仅通过污染 的训练经验,我们的攻击就能成功激活超过 的触发动作,使受害者的平均回合回报降低 。我们的新型攻击表明,在不可信的 RL 训练供应链下,RL 攻击很可能成为现实。
引用
@article{arxiv.2505.19532,
title = {Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning},
author = {Shijie Liu and Andrew C. Cullen and Paul Montague and Sarah Erfani and Benjamin I. P. Rubinstein},
journal= {arXiv preprint arXiv:2505.19532},
year = {2025}
}