中文

在模拟零和网络环境中针对进攻性与防御性智能体的对抗强化学习

机器学习 2025-10-08 v1 人工智能 密码学与安全

摘要

本文通过定制的 OpenAI Gym 环境对网络安全中的对抗强化学习进行控制性研究,模型包含暴力破解攻击与多端口服务上的反应防御。该环境捕捉了真实的安全权衡,包括背景流量噪声、渐进式利用机制、基于 IP 的规避策略、蜜罖陷阱以及多级速率限制防御。在零和奖励框架下训练攻击者与防御者智能体,使用深度 Q 网络 (DQN)。成功利用会获得大额终端奖励,而增量动作则产生小额代价。通过在多个配置( varying trap 检测概率、利用难度阈值、训练方案)下进行系统评估,结果表明防御者的可见性和陷阱有效性对成功攻击构成重大障碍。实验揭示奖励塑造和谨慎的训练调度在该对抗环境中至关关键。防御者在 50000+ 训练剧集中始终保持战略优势,性能提升在面对包含自适应 IP 屏蔽和端口特定控制等复杂防御策略时尤为显著。提供完整的实现细节、可复现的超参数配置以及架构指南,以支持未来在网络安全领域进行对抗 RL 研究。该零和公式和真实的运营约束使该环境适用于研究自主防御系统、攻击者-防御者共演化以及迁移到现实网络安全情景的学习。

关键词

引用

@article{arxiv.2510.05157,
  title  = {Adversarial Reinforcement Learning for Offensive and Defensive Agents in a Simulated Zero-Sum Network Environment},
  author = {Abrar Shahid and Ibteeker Mahir Ishum and AKM Tahmidul Haque and M Sohel Rahman and A. B. M. Alim Al Islam},
  journal= {arXiv preprint arXiv:2510.05157},
  year   = {2025}
}

备注

8 pages, 5 tables, 5 figures. 12th International Conference on Next Generation Computing, Communication, Systems and Security