中文

少即是多?RL中用于网络防御的奖励机制

机器学习 2025-03-11 v2 人工智能 密码学与安全

摘要

过去几年中,基于深度强化学习的自主网络防御智能体引起了广泛关注。此类智能体通常在网络健身房(cyber gym)环境中训练,也称为网络模拟器,目前至少已有32个被构建。大多数(如果不是全部)网络健身房提供密集的'脚手架式'奖励函数,这些函数结合了针对一系列(不)期望状态和代价行为的多种惩罚或激励。虽然密集奖励有助于缓解探索复杂环境的挑战,能从相对较少的环境步骤中产生看似有效的策略;但它们也已知会偏智能体所能找到的解,可能导致次优解。这在复杂的网络环境中尤其成问题,因为策略弱点可能在被攻击者利用之前未被察觉。在本工作中,我们着手评估稀疏奖励函数是否可能用于训练更有效的网络防御智能体。为实现这一目标,我们首先通过提出一个超越标准RL范式的地面真实评估分数,突破了现有工作中的若干评估局限。通过适配一个成熟的网络健身房以容纳我们的方法和地面真实分数,我们提出并评估了两种稀疏奖励机制,并将它们与典型的密集奖励进行比较。我们的评估考虑了从2到50个节点的多种网络规模,以及反应性和主动性防御行为。我们的结果表明,稀疏奖励,特别是对未受破坏网络状态的正向强化,能够训练出更有效的网络防御智能体。此外,我们证明稀疏奖励比密集奖励提供更稳定的训练,且有效性和训练稳定性对多种网络环境因素具有鲁棒性。

关键词

引用

@article{arxiv.2503.03245,
  title  = {Less is more? Rewards in RL for Cyber Defence},
  author = {Elizabeth Bates and Chris Hicks and Vasilios Mavroudis},
  journal= {arXiv preprint arXiv:2503.03245},
  year   = {2025}
}

备注

4 Pages