中文

通过递归分解的可扩展入侵响应学习

系统与控制 2024-04-23 v2 密码学与安全 机器学习 系统与控制

摘要

我们研究 IT 基础设施的自动化入侵响应,并将攻击者与防御者之间的交互建模为部分可观测随机博弈。为求解该博弈,我们遵循一种攻击与防御策略通过强化学习和自我博弈共同演化至均衡的方法。先前工作提出的解决方案证明了该方法在小型基础设施上的可行性,但由于计算复杂度随基础设施规模呈指数增长,无法扩展到现实场景。我们通过引入一种将博弈递归分解为可并行求解子博弈的方法来解决此问题。应用最优停止理论,我们表明这些子博弈中的最佳响应策略呈现阈值结构,从而能够高效计算它们。为求解分解后的博弈,我们引入一种称为分解虚拟自我博弈(DFSP)的算法,其通过随机逼近学习纳什均衡。我们在能够执行真实入侵与响应动作的仿真环境中评估所学策略。结果表明,所学策略逼近均衡,且 DFSP 在现实基础设施配置下显著优于最先进算法。

关键词

引用

@article{arxiv.2309.03292,
  title  = {Scalable Learning of Intrusion Responses through Recursive Decomposition},
  author = {Kim Hammar and Rolf Stadler},
  journal= {arXiv preprint arXiv:2309.03292},
  year   = {2024}
}

备注

A shortened version of this paper will appear in the conference proceedings of GameSec 2023