SAC-AP:基于软演员-评论家的深度强化学习用于告警优先级排序
密码学与安全
2022-08-04 v3
摘要
入侵检测系统(IDS)会产生大量误告警,使得检查真实告警变得困难。因此,告警优先级排序在决定从 IDS 生成的海量告警中调查哪些告警方面起着关键作用。最近,基于深度强化学习(DRL)的深度确定性策略梯度(DDPG)离策略方法已被证明在告警优先级排序上比其他最先进的方法取得更好的结果。然而,DDPG 容易过拟合。此外,它的探索能力较差,因此不适合具有随机环境的问题。为解决这些局限,我们提出了一种基于软演员-评论家的 DRL 告警优先级排序算法(SAC-AP),这是一种离策略方法,基于最大熵强化学习框架,旨在最大化期望奖励的同时也最大化熵。进一步地,将攻击者与防御者之间的交互建模为零和博弈,并利用双重预言机框架来获得近似混合策略纳什均衡(MSNE)。SAC-AP 寻找鲁棒的告警调查策略,并针对对手的混合策略计算纯策略最优响应。我们给出了 SAC-AP 的整体设计,并与其他最先进的告警优先级排序方法比较评估了其性能。我们将防御者损失(即防御者未能调查由攻击触发的告警)作为性能指标。我们的结果表明,与基于 DDPG 的告警优先级排序方法相比,SAC-AP 使防御者损失降低多达 30%,从而提供更好的入侵防护。此外,当 SAC-AP 与其他传统告警优先级排序方法(包括 Uniform、GAIN、RIO 和 Suricata)比较时,优势更为明显。
引用
@article{arxiv.2207.13666,
title = {SAC-AP: Soft Actor Critic based Deep Reinforcement Learning for Alert Prioritization},
author = {Lalitha Chavali and Tanay Gupta and Paresh Saxena},
journal= {arXiv preprint arXiv:2207.13666},
year = {2022}
}
备注
8 pages, 8 figures, IEEE WORLD CONGRESS ON COMPUTATIONAL INTELLIGENCE 2022