揭露 RL 中的漏洞:通过奖励投毒实施新型隐蔽后门攻击
密码学与安全
2025-12-01 v1
摘要
强化学习 (RL) 已在各个领域取得巨大成功,使自主系统能够通过优化奖励函数来学习和适应动态环境。然而,这种对奖励信号的依赖性创造了显著的安全漏洞。本文研究了一种通过投毒奖励信号来操纵代理策略的隐蔽后门攻击。该攻击的有效性凸显了对部署 RL 系统进行训练时操纵的严重威胁,迫切需要针对训练时操纵的防御措施。我们在经典控制和 MuJoCo 环境中评估了该攻击。在 Hopper 和 Walker2D 中,后门化的代理保持高度隐蔽性,在未触发情形下的性能下降仅为 2.18% 和 4.59%,而在触发情形下的攻击效果则达到 82.31% 和 71.27% 的显著下降。
引用
@article{arxiv.2511.22415,
title = {Exposing Vulnerabilities in RL: A Novel Stealthy Backdoor Attack through Reward Poisoning},
author = {Bokang Zhang and Chaojun Lu and Jianhui Li and Junfeng Wu},
journal= {arXiv preprint arXiv:2511.22415},
year = {2025}
}
备注
Workshop on Safe and Robust Robot Learning for Operation in the Real World at CoRL 2025