一种用于 PDF 恶意软件检测的小规模特征集
密码学与安全
2023-08-11 v2 机器学习
摘要
基于机器学习(ML)的恶意软件检测系统正变得愈发重要,因为恶意软件威胁不断增加且日益复杂。PDF 文件常作为钓鱼攻击的载体,因为它们被广泛视为可信的数据资源,且可跨不同平台访问。因此,研究者已开发了许多不同的 PDF 恶意软件检测方法。PDF 恶意软件检测的性能深受特征选择影响。本研究中,我们提出一组不需要过多 PDF 文件领域知识的小规模特征。我们用六种不同机器学习模型评估所提特征,在使用随机森林(Random Forest)模型时报告了 99.75% 的最佳准确率。我们提出的仅由 12 个特征组成的特征集,是 PDF 恶意软件检测领域最简洁的之一。尽管规模不大,我们取得了与采用大得多特征集的当前最优(SOTA)方法相当的结果。
引用
@article{arxiv.2308.04704,
title = {A Feature Set of Small Size for the PDF Malware Detection},
author = {Ran Liu and Charles Nicholas},
journal= {arXiv preprint arXiv:2308.04704},
year = {2023}
}
备注
Accepted for publication at the ACM SIGKDD & Annual KDD Conference workshop on Knowledge-infused Machine Learning, 2023