中文

SoK:深度强化学习在网络安全中的陷阱

机器学习 2026-02-10 v1 密码学与安全

摘要

深度强化学习(DRL)在需要序列决策的领域取得了显著成功,这推动了其在网络安全问题中的应用。然而,将DRL从实验室模拟迁移到定制的网络环境可能会引入许多问题。大多数网络安全任务通常具有对抗性、非平稳性和部分可观测性,这进一步加剧了问题。在本文中,我们识别并系统化了在DRL for Cybersecurity (DRL4Sec) 文献中,跨环境建模、智能体训练、性能评估和系统部署阶段经常出现的11个方法论陷阱。通过分析66篇重要的DRL4Sec论文(2018-2025年),我们量化了每个陷阱的普遍性,发现每篇论文平均有超过五个陷阱。我们通过以下方面的受控实验展示了这些陷阱的实际影响:(i) 自主网络防御,(ii) 对抗性恶意软件创建,以及 (iii) Web安全测试环境。最后,我们为每个陷阱提供了可操作的建议,以支持开发更严谨、更可部署的基于DRL的安全系统。

关键词

引用

@article{arxiv.2602.08690,
  title  = {SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity},
  author = {Shae McFadden and Myles Foley and Elizabeth Bates and Ilias Tsingenopoulos and Sanyam Vyas and Vasilios Mavroudis and Chris Hicks and Fabio Pierazzi},
  journal= {arXiv preprint arXiv:2602.08690},
  year   = {2026}
}