ACDZero:掌握自动网络防御的 MCTS 智能体
机器学习
2026-01-12 v2
摘要
自动网络防御 (ACD) 旨在以最小或无人工干预的方式保护计算机网络,通过采取纠正措施如隔离主机、重置服务、部署诱饵或更新访问控制来应对入侵。然而,现有的 ACD 方法,如深度强化学习 (RL),在复杂网络中面临困难的探索问题,决策/状态空间庞大,从而需要大量样本。受学习样本高效防御策略的需求启发,我们将 ACD 在 CAGE Challenge 4 (CAGE-4 / CC4) 中的情境建模为基于上下文的部分可观测马尔可夫决策过程,并提出基于蒙特卡洞树搜索 (MCTS) 的规划导向防御策略。该策略显式地建模了探索-开发之间的权衡,在 ACD 中使用统计抽样来指导探索和决策。我们创新性地利用图神经网络 (GNN) 将网络观察嵌入为带属性的图,从而实现对主机及其关系的置换不变推理。为使解决方案在复杂搜索空间中实用,我们结合模型无关的泛化和策略蒸馏,利用学习的图嵌入和图编辑动作上的先验指导 MCTS,将前瞻规划与深度学习相结合。我们在涉及多样化网络结构和对手行为的 CC4 场景中评估了所得智能体,结果表明,基于图嵌入的搜索引导规划在防御奖励和鲁棒性方面优于最新的 RL 基线。
引用
@article{arxiv.2601.02196,
title = {ACDZero: MCTS Agent for Mastering Automated Cyber Defense},
author = {Yu Li and Sizhe Tang and Rongqian Chen and Fei Xu Yu and Guangyu Jiang and Mahdi Imani and Nathaniel D. Bastian and Tian Lan},
journal= {arXiv preprint arXiv:2601.02196},
year = {2026}
}