QFlip:一种用于 FlipIt 安全博弈的自适应强化学习策略
密码学与安全
2019-12-24 v3 计算机科学与博弈论
机器学习
摘要
高级持续性威胁(APTs)的增多使得抵御长期、隐蔽且能规避现有密码学安全保证的攻击成为必要。FlipIt 是一种安全博弈,用于建模 APT 等高级场景中的攻击者与防御者交互。先前的工作广泛分析了 FlipIt 中的非自适应策略,但在实际交互中,由于玩家在博弈过程中获得反馈,自适应策略会自然出现。我们将 FlipIt 博弈建模为马尔可夫决策过程,并提出了 QFlip,一种基于时序差分强化学习的 FlipIt 自适应策略。我们针对采用周期性(Periodic)策略的对手,证明了新策略收敛性的理论结果。我们通过将 QFlip 与特定对手进行广泛评估,实验验证了我们的分析。QFlip 在使用相应状态空间时,针对周期性和指数(Exponential)对手收敛到最优自适应策略。最后,我们提出了一种具有复合状态空间的广义 QFlip 策略,该策略在包括周期性和均匀(Uniform)在内的多种分布下优于贪心(Greedy)策略,且无需预先知晓对手策略。我们还发布了一个用于 FlipIt 的 OpenAI Gym 环境以促进未来研究。
引用
@article{arxiv.1906.11938,
title = {QFlip: An Adaptive Reinforcement Learning Strategy for the FlipIt Security Game},
author = {Lisa Oakley and Alina Oprea},
journal= {arXiv preprint arXiv:1906.11938},
year = {2019}
}
备注
Outstanding Student Paper award