Phish-Blitz:通过全面网页资源收集和视觉完整性保持来推进网络钓鱼检测
密码学与安全
2025-09-11 v1
摘要
网络钓鱼攻击日益普遍,攻击者不断创建欺骗性网页以窃取敏感信息。尽管机器学习和深度学习在网络钓鱼检测方面取得了进展,但攻击者不断开发新策略以规避检测模型。结果,网络钓鱼网页继续到达用户,其中许多用户无法识别网络钓鱼指示符。为提高检测准确率,模型必须在包含钓鱼网页和合法网页的大型数据集中进行训练,这些数据集包括URL、网页内容、屏幕截图和标志。然而,现有工具在收集所需资源方面存在困难,尤其是考虑到网络钓鱼网页的寿命很短,这限制了数据集的全面性。为此,我们引入Phish-Blitz,该工具下载钓鱼和合法网页及其关联资源(如屏幕截图)。与现有工具不同,Phish-Blitz捕获活跃网页屏幕截图,并更新资源文件路径以维持网页原始的视觉完整性。我们提供了一个包含8,809个合法网页和5,000个钓鱼网页的数据集,包括所有关联资源。该数据集和工具均公开于GitHub,为研究社区提供了一个更完整的数据集用于网络钓鱼检测。
引用
@article{arxiv.2509.08375,
title = {Phish-Blitz: Advancing Phishing Detection with Comprehensive Webpage Resource Collection and Visual Integrity Preservation},
author = {Duddu Hriday and Aditya Kulkarni and Vivek Balachandran and Tamal Das},
journal= {arXiv preprint arXiv:2509.08375},
year = {2025}
}