中文

通过 JavaScript 能力特征描绘钓鱼页面

密码学与安全 2025-09-17 v1

摘要

2024 年,反钓鱼工作组识别出超过一百万个钓鱼页面。骗子通过使用钓鱼套件——即即插即用钓鱼网站——快速部署具有特定数据外泄、规避或模仿技术的钓鱼活动。相比之下,研究人员和防御者仍基于页面逐一进行防御,依赖手动分析识别静态特征以进行套件识别。本文旨在通过自动化手段帮助研究人员和分析师,根据底层套件对钓鱼页面进行分组,自动化此前的手动过程,并衡量不同客户端技术在这些分组中的流行程度。对于套件检测,我们的系统在拥有 548 个套件家族、4562 个钓鱼 URL 的基准数据集上达到 97% 的准确率。在无标签数据集上,我们利用 434050 个钓鱼页面 JavaScript 逻辑的复杂度将其分组为 11377 个簇,并标注这些簇所采用的钓鱼技术。我们发现,UI 交互性和基础指纹识别是普遍技术,分别出现在 90% 和 80% 的簇中。另一方面,尽管使用 7 年-old 开源钓鱼套件的部署中存在,但通过浏览器鼠标 API 检测鼠标是最少见的行为。我们的方法和发现为研究人员和分析师提供了新的方式来应对钓鱼页面的规模。

关键词

引用

@article{arxiv.2509.13186,
  title  = {Characterizing Phishing Pages by JavaScript Capabilities},
  author = {Aleksandr Nahapetyan and Kanv Khare and Kevin Schwarz and Bradley Reaves and Alexandros Kapravelos},
  journal= {arXiv preprint arXiv:2509.13186},
  year   = {2025}
}