PNAct:面向安全强化学习的后门攻击框架
机器学习
2025-07-02 v1 人工智能
摘要
强化学习 (RL) 在代理与环境交互以最大化奖励的任务中广泛应用。基于这一基础,安全强化学习 (Safe RL) 在奖励指标之外还融合了代价指标,确保代理在决策过程中遵守安全约束。在本文中,我们指出 Safe RL 对后门攻击极其脆弱,这类攻击可操控代理执行不安全动作。首先,我们引入了针对 Safe RL 领域的后门攻击概念与评估指标。这是一个首个涉及正负动作样本 (Positive and Negative Action sample, PNAct) 的攻击框架,用以植入后门,其中正动作样本提供参考动作,负动作样本则指示需避免的动作。我们理论地指出了 PNAct 的属性并设计了攻击算法。最后,我们通过实验评估了所提出的后门攻击框架的有效性,并使用既定指标进行评估。本文凸显了 Safe RL 潜在风险,并彰显了此类攻击的可行性。我们的代码与补充材料已公开于 https://github.com/azure-123/PNAct。
引用
@article{arxiv.2507.00485,
title = {PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning},
author = {Weiran Guo and Guanjun Liu and Ziyuan Zhou and Ling Wang},
journal= {arXiv preprint arXiv:2507.00485},
year = {2025}
}