中文

基于机器学习技术的恶意网站检测

密码学与安全 2022-09-21 v1 机器学习

摘要

在检测恶意网站时,一种常见的方法是使用黑名单,但黑名单本身并不详尽,且无法泛化到新的恶意站点。自动检测新遇到的恶意网站将有助于减少对此类攻击的脆弱性。在本研究中,我们探索了使用十种机器学习模型,基于词汇特征对恶意网站进行分类,并理解它们在不同数据集上的泛化能力。具体而言,我们在不同的数据集上训练、验证和测试了这些模型,随后进行了跨数据集分析。从我们的分析中,我们发现 K-Nearest Neighbor(K近邻)是唯一在跨数据集上表现持续优异的模型。其他模型如 Random Forest(随机森林)、Decision Trees(决策树)、Logistic Regression(逻辑回归)和 Support Vector Machines(支持向量机)在所有指标和数据集上也持续优于将每个链接都预测为恶意的基线模型。此外,我们发现没有任何证据表明任何词汇特征子集能够跨模型或跨数据集泛化。本研究应与网络安全专业人员和学术研究人员相关,因为它可构成实际检测系统或进一步研究工作的基础。

关键词

引用

@article{arxiv.2209.09630,
  title  = {Detection of Malicious Websites Using Machine Learning Techniques},
  author = {Adebayo Oshingbesan and Courage Ekoh and Chukwuemeka Okobi and Aime Munezero and Kagame Richard},
  journal= {arXiv preprint arXiv:2209.09630},
  year   = {2022}
}