SA-DRL:基于非对称奖励设计的勒索软件检测安全感知深度强化学习
密码学与安全
2026-07-08 v1
摘要
勒索软件检测是一项安全关键任务,其中假阴性与假阳性具有不对等的操作后果。传统的机器学习检测器通常使用对称目标,同等惩罚漏报的勒索软件检测和良性的误报,尽管假阴性可能导致不可逆的加密、操作中断和高昂的恢复成本,而假阳性通常是可以逆转的。本研究提出了一种安全感知深度强化学习(SA-DRL)框架,将假阴性和假阳性代价的不对称性嵌入到强化学习的奖励信号中,以优先减少漏检。该框架还引入了安全最优模型选择(SOMS)准则和自适应回合级样本排序机制。使用对称基线奖励(R1)和安全感知非对称奖励(R2)评估了四种深度强化学习智能体:DQN、DDQN、PPO 和 A2C。实验使用了四个折扣因子、五折交叉验证和三个随机种子,在平衡的勒索软件检测数据集上进行了 480 次训练运行。SOMS 准则通过优先考虑假阴性率,其次是 F1 分数和训练时间来选择模型。结果表明,非对称奖励塑造提高了面向安全的检测性能。SOMS 选定的配置,即使用 R2 和 gamma = 0.1 的 DDQN,实现了 0.0080 的假阴性率、0.9915 的 F1 分数和 0.998 的 AUC,与最佳监督基线相比减少了 67.6% 的漏检。在所有配置中,R2 相对于 R1 将平均假阴性率降低了 43%。这些发现表明,奖励函数设计对于安全敏感的勒索软件检测非常重要。
引用
@article{arxiv.2607.06880,
title = {SA-DRL: Security-Aware Deep Reinforcement Learning for Ransomware Detection with Asymmetric Reward Design},
author = {Jannatul Ferdous and Rafiqul Islam and Md Zahidul Islam},
journal= {arXiv preprint arXiv:2607.06880},
year = {2026}
}