基于 HTML 内容多模型分析的钓鱼网站检测
密码学与安全
2024-07-11 v3 人工智能
摘要
互联网的兴起显著改变了我们的沟通与工作方式。它虽开辟了新机遇,却也导致网络威胁增加。其中一种常见且严重的威胁是钓鱼攻击,网络犯罪分子利用欺骗手段窃取敏感信息。本研究针对这一紧迫的钓鱼问题,引入一种专注于 HTML 内容的高级检测模型。我们提出的方法集成了一个用于结构化表格数据的专用多层感知机(MLP)模型,以及两个用于分析页面标题和内容等文本特征的预训练自然语言处理(NLP)模型。这些模型的嵌入通过一种新颖的融合过程和谐地组合在一起,所得的融合嵌入随后输入一个线性分类器。鉴于近期用于全面钓鱼研究的数据集稀缺,我们的贡献还包括创建一个最新的数据集,并公开与社区共享。该数据集经过精心整理,以反映真实的钓鱼环境,确保相关性和适用性。研究结果凸显了所提方法的有效性,其中 CANINE 在分析页面标题方面表现出优越性能,而 RoBERTa 在评估页面内容方面表现卓越。融合两个 NLP 模型和一个 MLP 模型(称为 MultiText-LP)取得了令人瞩目的成果,在我们的研究数据集上获得了 96.80 的 F1 分数和 97.18 的准确率。此外,我们的方法在 CatchPhish HTML 数据集上优于现有方法,展示了其有效性。
引用
@article{arxiv.2401.04820,
title = {Phishing Website Detection through Multi-Model Analysis of HTML Content},
author = {Furkan Çolhak and Mert İlhan Ecevit and Bilal Emir Uçar and Reiner Creutzburg and Hasan Dağ},
journal= {arXiv preprint arXiv:2401.04820},
year = {2024}
}