中文

面向反馈赋能网络弹性的强化学习

密码学与安全 2021-12-08 v2 机器学习 系统与控制 系统与控制

摘要

数字化与远程连接扩大了攻击面并使网络系统更加脆弱。随着攻击者变得日益复杂且资源充足,仅依赖传统网络防护(如入侵检测、防火墙与加密)不足以保障网络系统安全。网络弹性提供了一种新的安全范式,以弹性机制补充不充分的保护。网络弹性机制(CRM)实时适应已知或零日威胁与不确定性,并策略性地响应它们,以在成功攻击事件下维持网络系统的关键功能。反馈架构在赋能 CRM 的在线感知、推理与执行过程中发挥关键作用。强化学习(RL)是体现网络弹性反馈架构的重要工具。它使 CRM 能够在对环境与攻击者有限或无需先验知识的情况下,提供对攻击的序贯响应。本工作中,我们综述了关于面向网络弹性的 RL 的文献,并讨论了针对三类主要漏洞(即姿态相关、信息相关与人为相关漏洞)的网络弹性。我们介绍了 CRM 的三个应用领域:移动目标防御、防御性网络欺骗与辅助性人类安全技术。RL 算法自身也存在漏洞。我们阐释了 RL 的三类漏洞,并给出了攻击者以环境与智能体间交换的信息为目标的攻击模型:奖励、状态观测与动作指令。我们表明攻击者能以最小攻击代价诱骗 RL 智能体学习恶意策略。最后,我们讨论了 RL 用于网络安全与弹性的未来挑战以及基于 RL 的 CRM 的新兴应用。

关键词

引用

@article{arxiv.2107.00783,
  title  = {Reinforcement Learning for Feedback-Enabled Cyber Resilience},
  author = {Yunhan Huang and Linan Huang and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2107.00783},
  year   = {2021}
}