中文

从过去到现在:恶意 URL 检测技术、数据集和代码仓库综述

密码学与安全 2025-06-03 v2 机器学习

摘要

恶意 URL 持续威胁网络安全生态系统, 它们通过欺骗用户泄露私人数据或分发有害负载以侵入主机系统。及时获取洞察当前这场持续战斗的最新状况具有重要意义。然而, 现有综述存在 4 个关键缺口: 1) 其依赖于算法中心的分类法掩盖了如何利用特定模态信息通道进行检测的理解; 2) 未纳入关键 LLM/Transformer 基于防御; 3)未收集开源实现以促进基准测试; 4)数据集覆盖不足。本文综述了恶意 URL 检测技术, 系统性地分析了从传统黑名单到高级深度学习方法(如 Transformer、GNN 和 LLM)的技术。 不同于以往综述, 我们提出了一种基于模态的新型分类法, 将现有工作按其主要数据模态(URL、HTML、视觉等)进行分类。 这种层次化分类既实现严格的技术分析, 又清晰地理解了多模态信息的利用。 此外, 为建立可获取数据集的概览并解决标准化基准测试不足的问题(其中当前研究常缺乏适当的基线比较), 我们精选并分析了: 1) 可公开获取的数据集(2016-2024 年), 和 2) 来自已发表作品的开源实现(2013-2025 年)。 然后, 我们概述了面向产品级实现的基本设计原则和架构框架。 综述通过检阅新兴挑战并提出可操作的未来研究方向来结束。 我们维护一个 GitHub 仓库用于持续整理数据集和开源实现:https://github.com/sevenolu7/Malicious-URL-Detection-Open-Source/tree/master。

关键词

引用

@article{arxiv.2504.16449,
  title  = {From Past to Present: A Survey of Malicious URL Detection Techniques, Datasets and Code Repositories},
  author = {Ye Tian and Yanqiu Yu and Jianguo Sun and Yanbin Wang},
  journal= {arXiv preprint arXiv:2504.16449},
  year   = {2025}
}

备注

This manuscript is currently under review at Computer Science Review