NASimJax:渗透测试的 GPU 加速策略学习框架
机器学习
2026-03-23 v1 密码学与安全
摘要
渗透测试是模拟网络攻击以识别漏洞的实践,属于固有部分可观测且具有大规模动作空间的序列决策任务。训练用于此领域的强化学习(RL)策略面临根本性瓶颈:现有模拟器在规模化的真实网络情景下运行过慢,导致所训练的策略难以泛化。我们提出 NASimJax,即基于 JAX 的 Network Attack Simulator 完整重实现,实现了最高可达原模拟器 100 倍的环境吞吐量。通过在硬件加速器上运行整个训练管道,NASimJax 使我们能够在固定计算预算下实验更大的网络规模,这些之前是不可行的。我们将自动化渗透测试建模为情境部分可观测马尔可夫决策过程(Contextual POMDP),并引入一种产生结构上多样且保证可解情景的网络生成管道。结合这些,为研究零样本策略泛化提供原则性基础。我们利用该框架调查动作空间的规模问题及网络间的泛化。在主机数达 40 个的网络上实验发现,优先级关卡复放(Prioritized Level Replay)在处理密集训练分布方面优于域随机化(Domain Randomization),尤其在更大规模下更为突出;训练稀疏拓扑可隐式形成课程,提升即使在更密集的拓扑上也能实现的外分布泛化。为处理线性增长的动作空间,我们提出两种阶段动作分解(2SAS),显著优于大规模下的平坦动作掩码。最后,我们识别出一种由优先级关卡复放的剧集重置行为与 2SAS 信用分配结构引发的失效模式。NASimJax 因此提供了一个快速、灵活且符合现实感的平台,推动 RL 基于渗透测试的发展。
引用
@article{arxiv.2603.19864,
title = {NASimJax: GPU-Accelerated Policy Learning Framework for Penetration Testing},
author = {Raphael Simon and José Carrasquel and Wim Mees and Pieter Libin},
journal= {arXiv preprint arXiv:2603.19864},
year = {2026}
}