中文

通过半马尔可夫决策过程强化学习的自适应蜜网诱捕

密码学与安全 2019-11-12 v2 人工智能 计算机科学与博弈论 机器学习

摘要

蜜网是一种有前景的主动网络防御机制。它通过在受控和受监控的环境中引诱攻击者实施对抗行为来揭示基本的妥协指标(IoCs)。蜜网中的主动交互带来高回报,但也引入了高实施成本与对抗性蜜网被利用的风险。本工作中,我们应用无限 horizon 半马尔可夫决策过程(SMDP)来刻画攻击者在蜜网中的随机转移与逗留时间,并量化回报-风险权衡。特别地,我们设计了被证明具有风险厌恶、成本效益和时间效率的自适应长期诱捕策略。数值结果表明,我们的自适应诱捕策略能快速将攻击者吸引到目标蜜罐,并使其参与足够长的时间以获取有价值的威胁信息。同时,渗透概率保持在低水平。结果显示期望效用对大范围持久性与智能程度的攻击者具有鲁棒性。最后,我们将强化学习应用于 SMDP 以解决建模维数灾难。在审慎选择学习率与探索策略下,我们实现了最优策略与价值函数的快速且鲁棒的收敛。

关键词

引用

@article{arxiv.1906.12182,
  title  = {Adaptive Honeypot Engagement through Reinforcement Learning of Semi-Markov Decision Processes},
  author = {Linan Huang and Quanyan Zhu},
  journal= {arXiv preprint arXiv:1906.12182},
  year   = {2019}
}

备注

The presentation can be found at https://youtu.be/GPKT3uJtXqk. arXiv admin note: text overlap with arXiv:1907.01396