使用 POMDP 模型学习 CAGE-2 的最优防御策略
机器学习
2026-01-07 v2 人工智能
摘要
CAGE-2 是学习和评估防御策略以应对网络攻击的公认基准。它反映了一个防御代理保护 IT 基础设施免受各种攻击的场景。文献中已提出了许多针对 CAGE-2 的防御方法。在本文中,我们使用部分可观测马尔可夫决策过程(POMDP)框架为 CAGE-2 构建了一个形式化模型。基于该模型,我们为 CAGE-2 定义了最优防御策略,并提出了一种高效学习该策略的方法。我们的方法称为 BF-PPO,基于 PPO,并使用粒子滤波来缓解由于 CAGE-2 模型大状态空间带来的计算复杂度。我们在 CAGE-2 CybORG 环境中评估了我们的方法,并将其性能与 CAGE-2 排行榜上排名第一的方法 CARDIFF 进行了比较。我们发现,我们的方法在学习到的防御策略和所需训练时间方面均优于 CARDIFF。
引用
@article{arxiv.2509.06539,
title = {Learning Optimal Defender Strategies for CAGE-2 using a POMDP Model},
author = {Duc Huy Le and Rolf Stadler},
journal= {arXiv preprint arXiv:2509.06539},
year = {2026}
}
备注
The paper is accepted for the 21st International Conference on Network and Service Management (CNSM-2025) and the official version is published in the conference proceedings