利用堆叠自编码器进行特征选择的勒索软件检测
机器学习
2024-04-24 v1 密码学与安全
摘要
本研究旨在提出并评估一种先进的勒索软件检测与分类方法,该方法结合堆叠自编码器(SAE)进行精确特征选择,并利用长短期记忆(LSTM)分类器以提高勒索软件分层的准确性。所提出的方法包括对 UGRansome 数据集进行彻底的预处理,训练无监督 SAE 以进行最优特征选择,或通过监督学习进行微调以提升 LSTM 模型的分类能力。本研究仔细分析了自编码器学习到的权重和激活值,以识别区分勒索软件家族与其他恶意软件的关键特征,从而构建用于精确分类的精简特征集。我们进行了广泛的实验,包括多达 400 个 epoch 和不同的学习率,以优化模型性能。结果表明,SAE-LSTM 模型在所有勒索软件家族中均表现出卓越性能,其高精度、高召回率和高 F1 分数彰显了其强大的分类能力。此外,平衡的平均得分证实了该模型能够有效泛化至各种恶意软件类型。该模型在勒索软件分类中达到了 99% 的卓越准确率,主要归功于其有效的 SAE 特征选择机制,超越了极端梯度提升(XGBoost)算法。该模型在识别签名攻击方面也表现出色,准确率达到 98%。
引用
@article{arxiv.2402.11342,
title = {Ransomware detection using stacked autoencoder for feature selection},
author = {Mike Nkongolo and Mahmut Tokmak},
journal= {arXiv preprint arXiv:2402.11342},
year = {2024}
}