中文

用于海事运营技术网络安全的多智能体强化学习

机器学习 2024-06-14 v1 密码学与安全 多智能体系统

摘要

本文展示了自主网络防御应用于工业控制系统的潜力,并为进一步探索多智能体强化学习(MARL)在该问题领域的应用提供了基线环境。文中引入了一个通用综合平台管理系统(IPMS)的仿真环境 IPMSRL,并探索了将 MARL 用于通用海事 IPMS 运营技术(OT)自主网络防御决策的方法。OT 的网络防御行动不如企业 IT 领域成熟。这是由于 OT 基础设施相对脆弱,其源于遗留系统的使用、设计时的工程假设以及缺乏全面的现代安全控制。由于网络攻击复杂性的不断增加以及传统以 IT 为中心的网络防御解决方案的局限性,网络领域面临许多需要解决的障碍。传统的 IT 控制措施很少部署在 OT 基础设施上,即使部署了,某些威胁也未得到完全解决。在我们的实验中,多智能体近端策略优化(MAPPO)的共享 critic 实现优于独立近端策略优化(IPPO)。MAPPO 在 80 万个时间步后达到了最优策略(回合结果均值为 1),而 IPPO 在一百万个时间步后仅能达到 0.966 的回合结果均值。超参数调优极大地提升了训练性能。在一百万个时间步内,调优后的超参数达到了最优策略,而默认超参数仅能偶尔获胜,大多数模拟结果为平局。我们测试了一项真实世界约束,即攻击检测警报成功率,并发现在警报成功率降至 0.75 或 0.9 时,MARL 防御者仍能分别在超过 97.5% 或 99.5% 的回合中获胜。

关键词

引用

@article{arxiv.2401.10149,
  title  = {Multi-Agent Reinforcement Learning for Maritime Operational Technology Cyber Security},
  author = {Alec Wilson and Ryan Menzies and Neela Morarji and David Foster and Marco Casassa Mont and Esin Turkbeyler and Lisa Gralewski},
  journal= {arXiv preprint arXiv:2401.10149},
  year   = {2024}
}

备注

13 pages, 7 figures, Proceedings of the Conference on Applied Machine Learning in Information Security 2023 (CAMLIS)