中文

基于粗粒度特征分析的恶意网站识别:机器学习方法

密码学与安全 2024-09-13 v1

摘要

恶意网站检测是一个日益相关且复杂的任务,需要考虑大量细节。我们的目标是创建一个在尽可能多的细节上进行训练的机器学习模型,以对网站进行良恶性分类。如果是恶意的,该模型将对其所扮演的角色进行分类(如钓鱼、垃圾邮件、恶意软件托管等)。我们提出了77个特征,并创建了一个包含441,701个样本、覆盖9种网站分类的数据集来训练模型。我们将提出的特征按计算这些特征所需的时间和资源,以及每个特征子集纳入模型后性能变化分为多个特征子集。我们发现,随着更多特征子集被引入,最佳模型的性能不断提升。最终,我们的最佳模型能够以95.89%的准确率将网站分类为9种分类之一。我们随后研究了我们提出的特征在模型中的重要性排序,详细介绍了根据模型确定的前10大最相关特征。我们发现,我们提出的2个URL嵌入特征在最佳模型中最为重要,内容特征在前10名中占据一半的名额。其余名单由来自不同特征类别的单个特征组成,包括:主机特征、robots.txt特征、词汇特征和被动域名系统特征。

关键词

引用

@article{arxiv.2409.07608,
  title  = {Advancing Malicious Website Identification: A Machine Learning Approach Using Granular Feature Analysis},
  author = {Kinh Tran and Dusan Sovilj},
  journal= {arXiv preprint arXiv:2409.07608},
  year   = {2024}
}