自主网络防御智能体的实证博弈论分析
人工智能
2025-02-03 v1 密码学与安全
计算机科学与博弈论
摘要
近期日益复杂的网络攻击的兴起,引发了对鲁棒且具有弹性的自主网络防御(ACD)智能体的需求。鉴于所采用的网络攻击战术、技术和程序(TTPs)多种多样,期望采用能够产生可泛化策略的学习方法。与此同时,ACD 智能体的保障仍是一个开放性挑战。我们通过使用基于原则的双重预言机(Double Oracle, DO)算法,对用于 ACD 的深度强化学习(DRL)方法进行实证博弈论分析,从而应对这两个挑战。该算法依赖于对抗者之间相互迭代学习针对彼此策略的(近似)最佳响应;这对于自主网络作战智能体而言是一项计算成本高昂的任务。在这项工作中,我们引入并评估了一种理论严密、基于势函数的奖励塑造方法,以加速这一过程。此外,鉴于开源 ACD-DRL 方法的不断增加,我们将 DO 公式扩展为允许多重响应预言机(Multiple Response Oracles, MRO),为全面评估 ACD 方法提供了一个框架。
引用
@article{arxiv.2501.19206,
title = {An Empirical Game-Theoretic Analysis of Autonomous Cyber-Defence Agents},
author = {Gregory Palmer and Luke Swaby and Daniel J. B. Harrold and Matthew Stewart and Alex Hiles and Chris Willis and Ian Miles and Sara Farmer},
journal= {arXiv preprint arXiv:2501.19206},
year = {2025}
}
备注
21 pages, 17 figures, 10 tables