中文

应用动作掩码与课程学习技术在运营技术网络安全中利用强化学习提升数据效率与整体性能

密码学与安全 2024-09-18 v1 机器学习

摘要

在先前的工作中,开发了 IPMSRL 环境(Integrated Platform Management System Reinforcement Learning environment,集成平台管理系统强化学习环境),旨在模拟遭受网络攻击的 maritime vessel(海上舰艇)IPMS 子集,以训练防御性 RL 智能体。本文扩展了 IPMSRL 的应用以增强真实性,加入了误报警报和警报延迟等附加动态。在最困难的测试环境中,应用课程学习使回合奖励均值从基准结果 -2.791 提升至 -0.569。在最困难的测试环境中,应用动作掩码使回合奖励均值从基准结果 -2.791 提升至 -0.743。重要的是,这一性能水平在不到 100 万个时间步内即达到,其数据效率远超在 250 万个时间步后才达到较低性能水平的 vanilla PPO。本文中观察到的最高性能水平是由课程学习与动作掩码相结合的训练方法取得的,其回合奖励均值为 0.137。本文还引入了一个编码了网络安全最佳实践表示的基础硬编码防御智能体,为 RL 智能体所达到的回合奖励均值数据提供了背景参照。该硬编码智能体的回合奖励均值为 -1.895。因此,本文表明,应用课程学习和动作掩码(无论是独立还是协同应用)提供了一种克服运营技术网络安全威胁修复中存在的复杂现实动态的途径。

关键词

引用

@article{arxiv.2409.10563,
  title  = {Applying Action Masking and Curriculum Learning Techniques to Improve Data Efficiency and Overall Performance in Operational Technology Cyber Security using Reinforcement Learning},
  author = {Alec Wilson and William Holmes and Ryan Menzies and Kez Smithson Whitehead},
  journal= {arXiv preprint arXiv:2409.10563},
  year   = {2024}
}

备注

14 pages, 9 figures, CAMLIS'24: Conference on Applied Machine Learning for Information Security, October 24--25, 2024, Arlington, VA