NetForge_RL:用于异步多智能体网络防御的事件驱动时序图网络
摘要
多智能体强化学习 (MARL) 策略从模拟网络战役迁移到实际 Security Operations Centers (SOCs) 的过程,根本受限于 Sim2Real 差距。传统模拟器抽象掉网络协议物理,依赖同步时钟,提供干净的状态向量而非真实、嘈杂的遥测数据。为解决这些限制,我们引入 NetForge_RL:一个高保真网络作战模拟器,将网络防御重新表述为异步、连续时间 Parti ially Observable Semi-Markov Decision Process (POSMDP)。NetForge 强制执行 Zero-Trust Network Access (ZTNA) 约束,要求防御者处理 NLP 编码的 SIEM 遥测数据。关键在于,NetForge 通过双模式引擎原生桥接 Sim2Real 差距,允许在 mock hypervisor 中进行高吞吐 MARL 训练,在 Docker hypervisor 中进行零样本评估。为导航此连续时间 POSMDP,我们提出 Continuous-Time Graph MARL (CT-GMARL),利用固定步长 Neural Ordinary Differential Equations (ODEs) 处理不规则采样的警报。我们将框架与离散基线 (R-MAPPO, QMIX) 进行评估。实证结果表明,CT-GMARL 达到的收敛中位数 Blue reward 为 57,135 - 相较于 R-MAPPO 提升 2.0 倍,相较于 QMIX 提升 2.1 倍。关键在于,CT-GMARL 通过避免简单最小化风险而破坏网络效用的 "焚土式" 失效模式,恢复了比最强基线 12 倍更多的被破坏服务。在对 live Docker 环境进行零样本迁移测试时,CT-GMARL 政策实现了中位数 reward 为 98,026,验证了 Sim2Real 桥接。
引用
@article{arxiv.2604.09523,
title = {Event-Driven Temporal Graph Networks for Asynchronous Multi-Agent Cyber Defense in NetForge_RL},
author = {Igor Jankowski},
journal= {arXiv preprint arXiv:2604.09523},
year = {2026}
}
备注
26 pages, 14 figures, 5 tables