基于高维特征优化学习的高效恶意软件检测
摘要
使用机器学习进行恶意软件检测需要从二进制文件中提取特征,因为模型无法直接处理原始二进制文件。常见方法是使用 LIEF 进行原始特征提取和 EMBER 向量化器生成 2381 维特征向量。然而,这些特征的高维度引入了显著的计算挑战。本研究通过应用两种降维技术(XGBoost 基于特征选择和主成分分析 (PCA))来解决这些挑战。我们评估了三个降低后的特征维度 (128、256 和 384),分别对应原始 2381 个特征的约 5.4%、10.8% 和 16.1%,在四个模型 - XGBoost、LightGBM、Extra Trees 和 Random Forest - 上进行评估,这些模型使用由 EMBER-2018、ERMDS 和 BODMAS 数据集组成的统一训练、验证和测试划分。这种方法确保了泛化性,避免数据集偏差。实验结果表明,在 XGBoost 特征选择后使用 384 维特征集训练的 LightGBM 实现了在统一数据集上达到 97.52% 的最高准确率,提供了计算效率和检测性能之间的最佳平衡。该最佳模型在 61 分钟内使用 30 GB 内存和 19.5 GB 磁盘空间训练,能有效地对完全未见数据集进行泛化,在 TRITIUM 上的准确率为 95.31%,在 INFERNO 上的准确率为 93.98%。这些发现为在不损害准确率的前提下提供了面向可扩展、计算高效的恶意软件检测方法。
引用
@article{arxiv.2506.17309,
title = {Efficient Malware Detection with Optimized Learning on High-Dimensional Features},
author = {Aditya Choudhary and Sarthak Pawar and Yashodhara Haribhakta},
journal= {arXiv preprint arXiv:2506.17309},
year = {2025}
}
备注
This paper has been accepted for presentation at the International Conference on Innovations in Intelligent Systems: Advancements in Computing, Communication, and Cybersecurity (ISAC3)