中文

大规模恶意软件聚类:首个完整基准研究

密码学与安全 2025-12-03 v2 机器学习

摘要

近年来,恶意软件攻击仍以高频率发生。恶意软件专家寻求对 incoming samples 进行分类以确认其可信度或证明其恶意性。识别恶意软件样本组的一种方式是通过恶意软件聚类。尽管社区已有努力,但尚未充分探索包括良性样本的恶意软件聚类。此外,尽管存在更大的公共基准恶意软件数据集,恶意软件聚类研究仍避免在实验中充分利用这些数据集,常常采用仅包含少数家族的小型数据集。此外,当前针对恶意软件聚类的 state-of-the-art 解决方案尚不明确。本研究在 Bodmas 和 Ember 两个大型公共基准恶意软件数据集上评估恶意软件聚类质量并建立最佳成果。我们的研究是首次在整个恶意软件基准数据集上进行恶意软件聚类的。此外,我们通过包含良性样本来扩展恶意软件聚类任务。我们的结果表明,包含良性样本并不显著降低聚类质量。我们发现 Ember 与 Bodmas,以及一个私人行业数据集之间在聚类质量上存在差异。与流行观点相反,我们的顶级聚类性能者是 K-Means 和 BIRCH,而 DBSCAN 和 HAC 落后于人。

关键词

引用

@article{arxiv.2511.23198,
  title  = {Clustering Malware at Scale: A First Full-Benchmark Study},
  author = {Martin Mocko and Jakub Ševcech and Daniela Chudá},
  journal= {arXiv preprint arXiv:2511.23198},
  year   = {2025}
}

备注

pre-print of the paper (i.e. "submitted manuscript" version); small updates to the tables, figures, and text were made in order to report the correct results on Ember