中文

三思后行:利用原始 URL 与 HTML 特征检测钓鱼网页

密码学与安全 2023-09-06 v2

摘要

钓鱼网站传播非邀内容,并常被用于实施电子邮件与互联网欺诈;在任何用户信息提交前检测它们至关重要。近年来已作出若干努力来检测这些钓鱼网站。大多数现有方法利用网站文本内容中手工设计的词法与统计特征来训练分类模型以检测钓鱼网页。然而,这些钓鱼检测方法面临若干挑战,包括:1)提取手工特征繁琐,需要专业领域知识来确定哪些特征对特定平台有用;2)基于手工特征构建的模型难以捕捉 URL 与 HTML 内容中词与字符的语义模式。为应对这些挑战,本文提出 WebPhish,一种使用嵌入的原始 URL 与 HTML 内容进行训练的端到端深度神经网络,用于检测网站钓鱼攻击。首先,所提模型自动采用嵌入技术将相应字符提取为同源稠密向量。随后,拼接层合并 URL 与 HTML 嵌入矩阵。接着,使用卷积层建模其语义依赖关系。使用真实世界钓鱼数据进行了大量实验,取得了 98.1\% 的准确率,表明 WebPhish 在识别钓鱼页面上优于基线检测方法。

关键词

引用

@article{arxiv.2011.04412,
  title  = {Look Before You Leap: Detecting Phishing Web Pages by Exploiting Raw URL And HTML Characteristics},
  author = {Chidimma Opara and Yingke Chen and Bo. wei},
  journal= {arXiv preprint arXiv:2011.04412},
  year   = {2023}
}