中文

DRL 中的后门攻击:四个环境聚焦于分布内触发器

机器学习 2025-12-16 v3 密码学与安全

摘要

后门攻击(或Trojan攻击)通过隐藏深层神经网络模型中不良行为来构成安全风险。每日从互联网下载的开源神经网络模型可能包含后门,而第三方模型开发者也十分常见。为推动后门攻击缓解研究,本文开发了用于深度强化学习(DRL)智能体的多种Trojan模型。我们聚焦于分布内触发器,这类触发器发生于智能体的自然数据分布中,由于在模型部署期间攻击者能够轻易激活其优势,因而构成更大的安全威胁。我们在四个强化学习(RL)环境中实现后门攻击:LavaWorld、Randomized LavaWorld、Colorful Memory 和 Modified Safety Gymnasium。我们训练了各种干净模型和后门模型,以刻画这些攻击。我们发现,分布内触发器可能需要额外的实施 effort 且对模型而言更具挑战性,但即使采用基础数据投毒攻击,这些攻击仍然是DRL中的可行威胁。

关键词

引用

@article{arxiv.2505.17248,
  title  = {Backdoors in DRL: Four Environments Focusing on In-distribution Triggers},
  author = {Chace Ashcraft and Ted Staley and Josh Carney and Cameron Hickert and Derek Juba and Kiran Karra and Nathan Drenkow},
  journal= {arXiv preprint arXiv:2505.17248},
  year   = {2025}
}