中文

基于网格搜索优化的恶意 URL 检测

密码学与安全 2024-06-18 v1 机器学习

摘要

由于恶意网站可能收集非法信息,信任在线平台输入数据的准确性颇具挑战。面对此类恶意网站,逐个分析网站变得具有挑战性,难以高效地列出所有 Uniform Resource Locators(URL)的黑名单。此持续挑战凸显了强大的安全措施的必要性,以保护免受潜在威胁和未授权数据收集。为检测恶意网站所 posing 的风险,本文提出利用基于机器学习(ML)的技术。我们使用了包括 Hist Gradient Boosting Classifier(HGBC)、K 近邻(KNN)、逻辑回归(LR)、决策树(DT)、随机森林(RF)、多层感知器(MLP)、Light Gradient Boosting Machine(LGBM)和支持向量机(SVM)等多种 ML 技术来检测恶意和良性网站数据集。该数据集包含 1781 条恶意和良性网站数据,具有 13 个特征。首先,我们调查了数据集上的缺失值插值。随后,通过将数据缩放到 0 到 1 的范围内进行归一化。接着,我们利用合成少数过采样技术(SMOTE)来平衡训练数据,因为数据集不平衡。随后,我们将 ML 算法应用于平衡后的训练集。同时,所有算法都基于网格搜索进行优化。最后,根据准确率、精确率、召回率、F1 分数和曲线下面积(AUC)等指标对模型进行评估。结果表明,HGBC 分类器在上述指标方面优于其他分类器。

关键词

引用

@article{arxiv.2406.10286,
  title  = {Malicious URL Detection using optimized Hist Gradient Boosting Classifier based on grid search method},
  author = {Mohammad Maftoun and Nima Shadkam and Seyedeh Somayeh Salehi Komamardakhi and Zulkefli Mansor and Javad Hassannataj Joloudari},
  journal= {arXiv preprint arXiv:2406.10286},
  year   = {2024}
}

备注

10 pages, 4 figures