中文

RawMal-TF:按类型和家族标注的原始恶意软件数据集

密码学与安全 2025-07-01 v1 机器学习

摘要

本工作针对使用机器学习进行恶意软件分类这一挑战,开发了一个在恶意软件类型和家族两个层面进行标注的新型数据集。从VirusShare、VX Underground和MalwareBazaar等来源收集原始二进制文件,然后从二进制文件的名称中解析出家族信息,并整合来自ClarAVy的类型级标签。该数据集包括14种恶意软件类型和17个恶意软件家族,使用基于静态分析的统一特征提取管道进行处理,特别是从可移植可执行文件(PE)标题中提取特征,以支持高级分类任务。评估侧重于三个关键分类任务。在恶意软件与良性样本的二分类中,Random Forest和XGBoost在完整数据集上取得了高准确率,分别达到基于类型的检测准确率为98.5%,基于家族的检测准确率为98.98%。在使用1000个样本的截断数据集来评估在数据有限条件下的性能时,两种模型仍表现出色,分别实现了基于类型的检测准确率为97.6%,基于家族的检测准确率为98.66%。对于间类别分类,该模型在类型级别任务上达到最高97.5%的准确率,在家族级别任务上达到最高93.7%的准确率。在多类分类设置下,即将样本分配到正确的类型或家族时,SVM在类型标签上达到81.1%的准确率,而Random Forest和XGBoost在家族标签上约达到73.4%的准确率。结果突显了准确率与计算成本之间的实际权衡,表明在类型和家族层面进行标注能够实现更细粒度且更具洞察力的恶意软件分类。该工作为未来在高级恶意软件检测和分类研究奠定了稳健的基础。

关键词

引用

@article{arxiv.2506.23909,
  title  = {RawMal-TF: Raw Malware Dataset Labeled by Type and Family},
  author = {David Bálik and Martin Jureček and Mark Stamp},
  journal= {arXiv preprint arXiv:2506.23909},
  year   = {2025}
}