中文

LogGuardQ:用于安全日志网络安全异常检测的认知增强强化学习框架

机器学习 2025-09-16 v1 人工智能 密码学与安全

摘要

强化学习(RL)已经改变了序贯决策,但传统的算法如深度 Q 网络(DQN)和近端策略优化(PPO)在动态环境中往往难以实现高效探索、稳定性和适应性。本研究提出了 LogGuardQ(具有认知增强的自适应日志卫士),这是一个新颖的框架,它集成了受人类认知启发的双记忆系统以及由温度衰减和好奇心驱动的自适应探索策略。在一个包含 47.9% 异常的 1,000,000 条模拟访问日志数据集上进行了 20,000 回合的评估,LogGuardQ 达到了 96.0% 的检测率(相比之下 DQN 为 93.0%,PPO 为 47.1%),精确率为 0.4776,召回率为 0.9996,F1 分数为 0.6450。所有回合的平均奖励为 20.34 \pm 44.63(相比之下 DQN 为 18.80 \pm 43.98,PPO 为 -0.17 \pm 23.79),每回合平均步数为 5.0(各模型保持一致)。图形分析(包括使用 Savgol 滤波器平滑的学习曲线(窗口=501,多项式=2)、方差趋势、动作分布和累积检测)证明了 LogGuardQ 卓越的稳定性和效率。统计检验(Mann-Whitney U)证实了显著的性能优势(例如,对比 DQN 的 p = 0.0002 且效应量可忽略不计,对比 PPO 的 p < 0.0001 且效应量中等,以及 DQN 对比 PPO 的 p < 0.0001 且效应量较小)。通过连接认知科学和强化学习,LogGuardQ 为不确定环境中的自适应学习提供了一种可扩展的方法,在网络安全、入侵检测和不确定性下的决策方面具有潜在应用。

关键词

引用

@article{arxiv.2509.10511,
  title  = {LogGuardQ: A Cognitive-Enhanced Reinforcement Learning Framework for Cybersecurity Anomaly Detection in Security Logs},
  author = {Umberto Gonçalves de Sousa},
  journal= {arXiv preprint arXiv:2509.10511},
  year   = {2025}
}

备注

17 pages, 6 figures