通过强化学习与自我博弈发现有效安全策略
机器学习
2024-04-23 v2 密码学与安全
网络与互联网体系结构
机器学习
摘要
我们提出了一种针对入侵防御用例自动发现安全策略的方法。遵循该方法,我们将攻击者与防御者之间的交互建模为马尔可夫博弈,并让攻击与防御策略通过强化学习和自我博弈在没有人工干预的情况下演化。使用一个简单的基础设施配置,我们证明了有效的安全策略可以从自我博弈中涌现。这表明在其他领域取得巨大成功的自我博弈,在网络安全背景下同样有效。对收敛策略的检查表明,涌现的策略反映了常识性知识并与人类策略相似。此外,我们解决了该领域中强化学习的已知挑战,并提出了一种使用函数逼近、对手池和自回归策略表示的方法。通过评估,我们表明我们的方法优于两种基线方法,但自我博弈中的策略收敛仍然是一个挑战。
引用
@article{arxiv.2009.08120,
title = {Finding Effective Security Strategies through Reinforcement Learning and Self-Play},
author = {Kim Hammar and Rolf Stadler},
journal= {arXiv preprint arXiv:2009.08120},
year = {2024}
}