基于马尔可夫决策过程攻击者的隐蔽入侵防御的博弈论建模
密码学与安全
2026-03-11 v1 计算机科学与博弈论
摘要
互联网使用的快速扩张增加了系统暴露于网络威胁的程度,尤其是因其隐蔽性、持续时间长以及针对高价值资产的多阶段攻击而具有挑战性的高级持续性威胁(APT)尤为困难。本研究将APT演化建模为攻击者与防御者在攻击图上的战略互动。在对攻击者位置和进展有限信息的情况下,防御者在随机间隔时通过在网络上部署入侵检测传感器来采取行动。一旦检测到被破坏,受影响的组件将通过后门移除、补丁或系统重新配置等措施立即受到保护。同时,攻击者从侦察开始,然后通过网络,利用漏洞并安装后门以维持持久访问和适应性移动。此外,攻击者可能在连续防御操作之间采取多步行动,导致非对称的时间动态。防御者的目标是降低攻击者获得关键资产访问的可能性,而攻击者的目的在于增加这种可能性。我们在三种信息 regime 下研究此互动,反映了攻击者在行动前的不同知识水平:(i)斯塔克伯格情景,其中攻击者对防御者的策略拥有完整知识并可据此进行优化;(ii)盲目情景,其中攻击者没有信息并假设防御部署服从均匀信念;(iii)基于信念的框架,其中攻击者持有关于防御者行为的准确概率性信念。对于每种情景,我们通过解决相应的优化问题来推导出最优防御策略。
引用
@article{arxiv.2603.09587,
title = {Game-Theoretic Modeling of Stealthy Intrusion Defense against MDP-Based Attackers},
author = {Willie Kouam and Stefan Rass},
journal= {arXiv preprint arXiv:2603.09587},
year = {2026}
}