中文

BehaviorGuard:深度强化学习的在线后门防御

人工智能 2026-05-08 v1

摘要

后门攻击构成深度强化学习(DRL)的严重威胁。当前防御通常依赖奖励异常来逆向工程触发器和模型微调以移除后门。然而,复杂的触发器模式削弱了其鲁棒性,微调代价高昂,限制了实际应用。因此,我们将防御关注点转向触发器无关的后门输出行为,提出BehaviorGuard,一种针对DRL的在线行为基于后门检测和缓解框架。具体而言,我们发现无论攻击方式,后门策略都会导致动作分布发生一致偏移,以确保可靠激活,在高分位数区域和分布尾部留下可检测痕迹,即使没有触发器亦是如此。基于此,我们设计一种捕捉动作分布中行为漂移的新型指标,用于在运行时识别和抑制后门动作。鉴于这是首个在单智能体和多智能体DRL中对抗攻击的在线后门防御,BehaviorGuard在不同后门攻击的 diverse benchmark 上 consistently 超越先前方法在有效性和效率方面。

关键词

引用

@article{arxiv.2605.05977,
  title  = {BehaviorGuard: Online Backdoor Defense for Deep Reinforcement Learning},
  author = {Yinbo Yu and Xueyu Yin and Jiadai Wang and Chunwei Tian and Sai Xu and Qi Zhu and Daoqiang Zhang},
  journal= {arXiv preprint arXiv:2605.05977},
  year   = {2026}
}

备注

11 pages