Plan2Cleanse:基于 Monte-Carlo 规划的深度强化学习测试时后门防御
机器学习
2026-05-12 v1
摘要
确保强化学习 (RL) 模型的安全性至关重要,特别是当它们由第三方训练并部署于真实世界系统中时。攻击者可以在这些模型中植入后门,使其在典型条件下表现正常,但在特定触发器被激活时执行恶意行为。在本工作中,我们提出了 Plan2Cleanse,一个测试时检测与缓解框架,该框架适配 Monte Carlo 树搜索以高效识别并中和 RL 后门攻击,且无需模型重训练。我们的方法将后门检测重新表述为一个规划问题,能够系统探索时间延展的触发器序列,同时保持对目标策略的黑盒访问。利用检测结果,Plan2Cleanse 可以进一步通过树搜索预防性重规划实现高效缓解。我们在竞技 MuJoCo 环境、模拟 O-RAN 无线网络和 Atari 游戏中评估了该方法。Plan2Cleanse 取得了显著改进,在隐蔽的 O-RAN 场景中将触发器检测成功率提高了 61.4 个百分点以上,并在竞技 Humanoid 环境中将胜率从 35% 提升至 53%。这些结果证明了我们测试时防御方法的有效性,并突显了在 RL 部署中针对后门威胁进行主动防御的重要性。我们的实现已在 https://github.com/rl-bandits-lab/RL-Backdoor 公开发布。
引用
@article{arxiv.2605.09638,
title = {Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning},
author = {Sze-Ann Chen and Zhi-Yi Chin and Kui-Yuan Chen and Chi-Yu Li and Ping-Chun Hsieh},
journal= {arXiv preprint arXiv:2605.09638},
year = {2026}
}
备注
Published in Transactions on Machine Learning Research (TMLR)