NSGZero:基于神经蒙特卡洛树搜索在大规模网络安全博弈中高效学习不可利用策略
密码学与安全
2022-01-20 v1 人工智能
机器学习
多智能体系统
摘要
网络中关键目标的安全资源部署可通过网络安全博弈(NSGs)建模。尽管深度学习(DL)的最新进展为处理大规模 NSGs 提供了有力方法,但 NSG-NFSP 等 DL 方法存在数据效率低下的问题。此外,由于集中式控制,它们无法扩展到具有大量资源的场景。本文提出一种新颖的基于 DL 的方法 NSGZero,以在 NSGs 中学习不可利用策略。NSGZero 通过神经蒙特卡洛树搜索(MCTS)进行规划,从而提高了数据效率。我们的主要贡献有三方面:首先,我们设计深度神经网络(DNNs)以在 NSGs 中执行神经 MCTS;其次,我们使神经 MCTS 支持分散式控制,使 NSGZero 可应用于具有众多资源的 NSGs;第三,我们提供了一种高效学习范式,以实现 NSGZero 中 DNNs 的联合训练。与最先进算法相比,我们的方法实现了显著更优的数据效率与可扩展性。
引用
@article{arxiv.2201.07224,
title = {NSGZero: Efficiently Learning Non-Exploitable Policy in Large-Scale Network Security Games with Neural Monte Carlo Tree Search},
author = {Wanqi Xue and Bo An and Chai Kiat Yeo},
journal= {arXiv preprint arXiv:2201.07224},
year = {2022}
}
备注
Published as a conference paper in AAAI 2022