通过博弈对弈与最优停止学习安全策略
机器学习
2022-05-31 v1 人工智能
密码学与安全
网络与互联网体系结构
摘要
我们研究使用强化学习的自动化入侵防御。遵循一种新颖方法,我们将攻击者与防御者之间的交互表述为最优停止博弈,并让攻击与防御策略通过强化学习和自博弈演化。博弈论视角使我们能够找到对动态攻击者有效的防御者策略。最优停止表述让我们深入认识最优策略的结构,我们证明其具有阈值性质。为获得最优防御者策略,我们引入 T-FP,一种通过随机近似学习纳什均衡的虚拟自博弈算法。我们表明 T-FP 在我们的用例上优于一种 state-of-the-art 算法。我们用于学习与评估策略的整体方法包含两套系统:一套是防御者策略被增量学习的仿真系统,一套是产生驱动仿真运行的统计信息并评估所学策略的仿真模拟系统。我们得出结论,该方法能为实际 IT 基础设施产生有效的防御者策略。
引用
@article{arxiv.2205.14694,
title = {Learning Security Strategies through Game Play and Optimal Stopping},
author = {Kim Hammar and Rolf Stadler},
journal= {arXiv preprint arXiv:2205.14694},
year = {2022}
}