面向自动韧性网络防御的多目标强化学习
密码学与安全
2025-05-19 v2
摘要
网络攻击构成对军事指挥控制网络、情报、监视与侦察(ISR)系统以及民用关键基础设施的安全威胁。人工智能和自主代理在这些攻击中使用的增加放大了威胁的规模、范围和复杂性,并导致随之而来的中断。自主网络防御(ACD)代理旨在通过机器速度和所需规模来缓解这一威胁。深度强化学习(RL)等顺序决策算法为创建 ACD 代理提供了有前景的途径。这些算法聚焦于单一目标(如最小化红方代理对网络的渗透),通过使用手工加权奖励之和来实现。这种方法剥离了模型在推断期间适应的能力,未能解决在运营和保护这些网络时所面临的众多相互竞争目标的问题。诸如从备份映像恢复机器、与关联停机时间、网络流量或服务中断的成本等冲突目标必须仔细平衡。与追求单目标强化学习(SORL)方法不同,本文提出了一个简单的多目标网络防御游戏示例,需要同时考虑抵御红方代理的行为以及维持绿方代理的关键功能。我们使用两种多目标强化学习(MORL)算法,即多目标近端策略优化(MOPPO)和帕累托条件网络(PCN),创建了两个训练好的 ACD 代理,并在我们的多目标网络防御游戏中进行比较。基于对该游戏的调查,讨论了 MORL ACD 代理相对于 SORL ACD 代理的优势和局限性。
引用
@article{arxiv.2411.17585,
title = {Multi-Objective Reinforcement Learning for Automated Resilient Cyber Defence},
author = {Ross O'Driscoll and Claudia Hagen and Joe Bater and James M. Adams},
journal= {arXiv preprint arXiv:2411.17585},
year = {2025}
}
备注
9 pages, 9 figures