一种用于交互式检视已学习安全策略的系统
密码学与安全
2024-04-23 v2 机器学习
摘要
我们提出一种用于交互式检视已学习安全策略的系统。它允许用户以受控方式遍历马尔可夫决策过程的片段,并跟踪安全策略触发的动作。类似于软件调试器,用户可在任意时间步继续或暂停一个片段,并检查感兴趣的参数与概率分布。该系统能够洞察给定策略的结构以及策略在边缘情形下的行为。我们以网络入侵用例演示该系统。我们检视在攻击发生时 IT 基础设施状态的演变以及安全策略所规定的动作。演示所用的策略通过一种强化学习方法获得,该方法包含一个策略被增量学习的仿真系统,以及一个产生驱动仿真运行的统计量的仿真(emulation)系统。
引用
@article{arxiv.2204.01126,
title = {A System for Interactive Examination of Learned Security Policies},
author = {Kim Hammar and Rolf Stadler},
journal= {arXiv preprint arXiv:2204.01126},
year = {2024}
}
备注
Preprint, original submission to NOMS22 Demo track. Copyright IEEE, may be transferred without notice. arXiv admin note: text overlap with arXiv:2111.00289