用于检测高级持续性威胁的动态信息流跟踪博弈的强化学习方法
最优化与控制
2021-06-29 v2 计算机科学与博弈论
摘要
高级持续性威胁(APTs)是威胁敏感信息安全和隐私的隐蔽攻击。APT 与受害系统的交互引入了记录在系统日志中的信息流。动态信息流跟踪(DIFT)是一种用于检测 APT 的有前景的检测机制。DIFT 污染源于易受攻击的系统实体的信息流,跟踪被污染流的传播,并根据预定义安全策略在特定系统组件处对被污染流进行认证。DIFT 在 cyber 系统中部署以防御 APT 受到其与 DIFT 相关的沉重资源与性能开销的限制。本文中,我们通过纳入与 DIFT 相关的安全代价、假阳性与假阴性,提出一种资源高效的 DIFT 模型。具体而言,我们开发了博弈论框架并提供了 DIFT 的解析模型,使得能够研究资源效率与检测有效性之间的权衡。我们的博弈模型是非零和、无限 horizon、平均奖赏随机博弈。我们的模型纳入了由于 DIFT 无法区分恶意流与良性流以及 APT 无法知晓 DIFT 执行安全分析的位置而产生的玩家间信息不对称。此外,该博弈具有不完全信息,因为转移概率(假阳性与假阴性率)未知。我们提出一种多时间尺度随机近似算法以学习博弈的均衡解。我们证明该算法收敛到平均奖赏纳什均衡。我们在真实勒索软件数据集上评估所提模型与算法,并验证了所提方法的有效性。
引用
@article{arxiv.2007.00076,
title = {A Reinforcement Learning Approach for Dynamic Information Flow Tracking Games for Detecting Advanced Persistent Threats},
author = {Dinuka Sahabandu and Shana Moothedath and Joey Allen and Linda Bushnell and Wenke Lee and Radha Poovendran},
journal= {arXiv preprint arXiv:2007.00076},
year = {2021}
}
备注
15