在神经激活空间中缓解深度强化学习后门
机器学习
2024-07-23 v1 人工智能
密码学与安全
摘要
本文研究深度强化学习(DRL)代理策略中的后门威胁,并提出一种在运行时检测其方法。我们的研究聚焦于难以察觉的分布内后门触发器。此类触发器设计用于在行为上产生偏差,同时能够融入预期的数据分布以规避检测。在Atari Breakout环境中进行的实验表明,当前的清理方法在面对此类触发器时存在局限性,并探讨了其为何呈现具有挑战性防御问题。随后,我们评估了后门触发器可能更容易在DRL代理策略网络神经激活空间中被检测的假设。我们的统计分析表明,确实无论触发器在环境中多么well concealed,代理策略网络的激活模式在触发器存在时都会呈现差异。基于此,我们提出一种新型防御方法,该方法使用在干净环境样本上训练的分类器来检测异常激活。我们的結果表明,即使是轻量级的分类器也能在相当准确的情况下有效防止恶意行为,表明该研究方向即使针对复杂对手也具有潜力。
引用
@article{arxiv.2407.15168,
title = {Mitigating Deep Reinforcement Learning Backdoors in the Neural Activation Space},
author = {Sanyam Vyas and Chris Hicks and Vasilios Mavroudis},
journal= {arXiv preprint arXiv:2407.15168},
year = {2024}
}
备注
11 Pages, 12 figures