强化学习用于网络安全事件响应中的恶意软件调查
密码学与安全
2025-01-08 v2 人工智能
新兴技术
摘要
本研究聚焦于使用强化学习 (RL) 提高事后恶意软件取证调查的效率与效果。我们提出了一种先进的基于马尔可夫决策过程 (MDP) 的事后恶意软件取证调查模型和框架,以加速事后取证工作。随后,我们在所提框架内实现了基于结构化 MDP 的 RL 恶意软件调查模型。为识别恶意软件痕迹,RL 代理获取并检查取证证据文件,迭代式地通过 Q 表和时序差学习来提升其能力。Q 学习算法显著提高了代理识别恶意软件的能力。ε-贪婪探索策略和 Q 学习更新使代理能够高效学习和决策。我们的实验测试表明,最优学习率取决于 MDP 环境的复杂度,简单环境受益于更高的学习率以实现更快收敛,而复杂环境则需要更低的学习率以维持稳定性。我们的模型在识别和分类恶意软件方面的性能优于人类专家,显现出鲁棒性和适应性。该研究突显了超参数调优的重要性,并为复杂环境提出了自适应策略。我们的基于 RL 的方法取得了有前景的成果,已被证明是传统方法的有效替代方案,尤其在持续学习和适应新型和不断演变的恶意软件威胁方面具有优势,从而提升了事后取证调查的整体水平。
引用
@article{arxiv.2408.01999,
title = {Reinforcement Learning for an Efficient and Effective Malware Investigation during Cyber Incident Response},
author = {Dipo Dunsin and Mohamed Chahine Ghanem and Karim Ouazzane and Vassil Vassilev},
journal= {arXiv preprint arXiv:2408.01999},
year = {2025}
}
备注
21 pages