中文

使用机器学习、Transformer 和大语言模型从内存转储中进行恶意软件分类

机器学习 2025-03-05 v1 计算与语言 密码学与安全

摘要

本研究调查了在恶意软件分类任务中,使用不同特征集和数据配置的各种分类模型的性能。评估了六个模型——逻辑回归、K 近邻 (KNN)、支持向量机 (SVM)、决策树、随机森林 (RF) 和极端梯度提升 (XGB)——以及两个深度学习模型,循环神经网络 (RNN) 和 Transformer,还有 Gemini 零样本和少样本学习方法。测试了四个特征集,包括所有特征、文献回顾特征、RF 的前 45 个特征以及降采样后的前 45 个特征。XGB 使用前 45 个特征实现了 87.42% 的最高准确率,优于所有其他模型。RF 在相同特征集上紧随其后,准确率为 87.23%。相比之下,深度学习模型表现不佳,RNN 的准确率为 66.71%,Transformer 达到 71.59%。降采样降低了所有模型的性能,XGB 降至 81.31%。Gemini 零样本和少样本学习方法表现最低,准确率分别为 40.65% 和 48.65%。结果强调了特征选择在提高模型性能同时降低计算复杂性方面的重要性。像 XGB 和 RF 这样的传统模型表现出卓越的性能,而深度学习和少样本方法难以匹敌其准确率。本研究强调了传统机器学习模型对结构化数据集的有效性,并为未来研究混合方法和更大数据集奠定了基础。

关键词

引用

@article{arxiv.2503.02144,
  title  = {Malware Classification from Memory Dumps Using Machine Learning, Transformers, and Large Language Models},
  author = {Areej Dweib and Montaser Tanina and Shehab Alawi and Mohammad Dyab and Huthaifa I. Ashqar},
  journal= {arXiv preprint arXiv:2503.02144},
  year   = {2025}
}