中文

基于K-Means的基于散列的恶意软件聚类比较分析

密码学与安全 2025-12-11 v1 机器学习

摘要

随着多个数字设备在日常生活中的普及,网络攻击面不断扩大。对手不断探索新的攻击途径来利用这些设备并部署恶意软件。另一方面,检测方法通常采用基于散列的算法,如 SSDeep、TLSH 和 IMPHash 来捕获二进制文件的结构和行为相似性。本工作聚焦于使用K-Means算法对这些技术进行恶意软件样本聚类的分析和评估。更具体地,我们在已建立的恶意软件家族和特征上进行实验,发现 TLSH 和 IMPHash 产生更具辨识度和语义意义的聚类结果,而 SSDeep 在更广泛的分类任务中更高效。本工作的发现结果可指导开发更稳健的威胁检测机制和自适应安全机制。

关键词

引用

@article{arxiv.2512.09539,
  title  = {Comparative Analysis of Hash-based Malware Clustering via K-Means},
  author = {Aink Acrie Soe Thein and Nikolaos Pitropakis and Pavlos Papadopoulos and Sam Grierson and Sana Ullah Jan},
  journal= {arXiv preprint arXiv:2512.09539},
  year   = {2025}
}

备注

To be published in the proceedings of the 8th International Conference on Reliable Information and Communication Technology (IRICT 2025). Springer Book Series: "Lecture Notes on Data Engineering and Communications Technologies"