中文

天使还是恶魔:探究可塑性干预对深度强化学习中后门威胁的影响

机器学习 2026-05-15 v1 人工智能 密码学与安全

摘要

大量研究突显了后门攻击对深度强化学习(DRL)造成的严重威胁。然而,先前的研究主要集中在原始场景,而可塑性干预已成为现代 DRL 智能体不可或缺的内置组件。尽管这些干预在缓解可塑性损失方面很有效,但它们对 DRL 后门漏洞的影响仍未得到充分探索,且缺乏系统性研究给实际 DRL 部署带来了风险。为了弥补这一空白,我们实证研究了整合代表性干预和攻击场景的 14,664 个案例。我们发现只有一种干预(即 SAM)加剧了后门威胁,而其他干预则缓解了这些威胁。病理学分析表明,加剧归因于后门梯度放大,而缓解则源于激活路径破坏和表示空间压缩。基于这些发现,我们得出了两个新见解:(1)用于鲁棒后门注入的概念框架 SCC,它解构了 DRL 中干预与后门之间的机制相互作用;(2)异常损失景观锐度作为 DRL 后门检测的关键指标。

关键词

引用

@article{arxiv.2605.14587,
  title  = {Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning},
  author = {Oubo Ma and Ruixiao Lin and Yang Dai and Jiahao Chen and Chunyi Zhou and Linkang Du and Shouling Ji},
  journal= {arXiv preprint arXiv:2605.14587},
  year   = {2026}
}

备注

To appear in the Forty-Third International Conference on Machine Learning (ICML 2026), July 6-11, 2026, Seoul, South Korea