中文

基于实体的强化学习用于自主网络防御

机器学习 2025-01-27 v3 密码学与安全

摘要

自主网络防御的一个重大挑战是确保防御智能体能够泛化到不同的网络拓扑和配置。当部署在动态变化的环境中(例如设备可能频繁加入和离开的企业网络)时,这种能力对于智能体保持有效性是必要的。标准的深度强化学习方法(其中策略使用固定输入的多层感知器(MLP)进行参数化)期望固定大小的观测和动作空间。在自主网络防御中,这使得开发能够泛化到与训练时不同网络拓扑环境的智能体变得困难,因为节点数量会影响观测和动作空间的自然大小。为了克服这一限制,我们使用基于实体的强化学习重新构建了自主网络防御问题,其中智能体的观测和动作空间被分解为一系列离散实体。该框架使得能够使用专门用于组合泛化的策略参数化方法。我们在 Yawning Titan 网络安全模拟环境中训练了一个基于 Transformer 的策略,并测试了其在各种网络拓扑上的泛化能力。我们证明,当在不同拓扑的固定大小网络上进行训练时,该方法显著优于基于 MLP 的策略;当在单个网络上训练时,性能相当。我们还展示了向训练中未见过的不同大小网络进行零样本泛化的潜力。这些发现凸显了基于实体的强化学习通过提供能够处理真实世界网络环境变化的更可泛化策略,来推动自主网络防御领域的潜力。

关键词

引用

@article{arxiv.2410.17647,
  title  = {Entity-based Reinforcement Learning for Autonomous Cyber Defence},
  author = {Isaac Symes Thompson and Alberto Caron and Chris Hicks and Vasilios Mavroudis},
  journal= {arXiv preprint arXiv:2410.17647},
  year   = {2025}
}

备注

Material also appearing in the proceedings of the 1st International Workshop on Autonomous Cybersecurity at ACM CCS 2024