中文

DeepStage:针对多阶段APT战役的自主防御策略学习

密码学与安全 2026-05-05 v2 人工智能 机器学习

摘要

本文提出DeepStage,一个深度强化学习(DRL)框架,用于针对高级持久性威胁(APT)战役进行自适应且阶段感知的防御。企业环境被建模为部分可观测马尔可夫决策过程(POMDP),将主机关联数据和网络遥测融合为统一的关联图。基于我们先前的工作(StageFinder),DeepStage采用图神经网络编码器和基于LSTM的阶段估计器,推断出与MITRE ATT&CK框架对齐的攻击者阶段概率分布。所得的阶段信念与图嵌入一起,用于指导基于分层Proximal Policy Optimization(PPO)的代理器,选择监控、访问控制、隔离和修复等防御动作。在一个真实的企业测试环境中,使用CALDERA驱动的APT战役 playbook进行实验,DeepStage实现了0.887的平均F1分数和84.7%的缓解成功率,相较于基于风险的DRL基线在F1分数上提升21.8%,在缓解成功率上提升16.2%。结果表明,DeepStage实现了有效的阶段感知和成本效益的自主网络防御。

关键词

引用

@article{arxiv.2603.16969,
  title  = {DeepStage: Learning Autonomous Defense Policies Against Multi-Stage APT Campaigns},
  author = {Trung V. Phan and Tri Gia Nguyen and Thomas Bauschert},
  journal= {arXiv preprint arXiv:2603.16969},
  year   = {2026}
}

备注

This paper has been accepted for publication in IEEE International Conference on Cyber Security and Resilience (CSR) 2026