中文

贝叶斯斯塔克伯格马尔可夫博弈中的多智能体强化学习用于自适应移动目标防御

计算机科学与博弈论 2020-07-22 v1 人工智能 密码学与安全 机器学习

摘要

网络安全领域大多是一场猫鼠游戏,新攻击的发现引领方向。为剥夺攻击者的侦察优势,研究者提出了移动目标防御(MTD)等主动防御方法。为寻找良好的移动策略,研究者将MTD建模为防御者与网络 adversary 之间的领导者-跟随者博弈。我们认为,当关于理性 adversary 的信息不完全时,现有模型在序贯设定中是不充分的,并产生次优移动策略。此外,尽管在网络安全序贯设定中学习防御策略方面存在大量工作,它们或因不完全信息引起的可扩展性问题而不受欢迎,或倾向于忽略 adversary 的战略性而将场景简化为使用单智能体强化学习技术。为解决这些问题,我们提出(1)一个统一的博弈论模型,称为贝叶斯斯塔克伯格马尔可夫博弈(BSMG),可建模攻击者类型的不确定性和MTD系统的细微之处;(2)一种贝叶斯强斯塔克伯格Q学习(BSS-Q)方法,可通过交互在合理时间内学习BSMG的最优移动策略。我们将BSMG置于不完全信息马尔可夫博弈的版图中,并刻画其中的强斯塔克伯格均衡(SSE)概念。我们展示了我们的学习方法收敛到BSMG的SSE,然后强调所学移动策略(1)改进了Web应用安全中MTD的当前最优水平;(2)即使在缺乏关于奖励和转移的先验信息时,也能在具有关于 adversary 不完全信息的MTD域中收敛到最优策略。

关键词

引用

@article{arxiv.2007.10457,
  title  = {Multi-agent Reinforcement Learning in Bayesian Stackelberg Markov Games for Adaptive Moving Target Defense},
  author = {Sailik Sengupta and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2007.10457},
  year   = {2020}
}