用于恶意URL分类的新数据集与方法
机器学习
2025-01-03 v1 密码学与安全
摘要
恶意URL(统一资源定位符)分类是网络安全的一个关键方面,提供针对基于Web的威胁的防御。尽管深度学习在这一领域有前景,但其进展受到两个主要挑战的阻碍:缺乏全面的开源数据集,以及现有模型的局限性,这些模型要么缺乏实时能力,要么表现出次优性能。为了弥补这些空白,我们引入了一个新颖的多类恶意URL分类数据集,区分良性、钓鱼和恶意URL,命名为DeepURLBench。数据经过严格清洗和结构化,提供了优于现有数据集的替代方案。值得注意的是,与标准的二分类方法相比,多类方法提高了深度学习模型的性能。此外,我们提出了对基于字符串的URL分类器的改进,将这些增强应用于URLNet。其中关键的是集成DNS衍生特征,这丰富了模型的能力,并在保持实时运行效率的同时带来了显著的性能提升——为网络安全应用实现了有效的平衡。
引用
@article{arxiv.2501.00356,
title = {A New Dataset and Methodology for Malicious URL Classification},
author = {Ilan Schvartzman and Roei Sarussi and Maor Ashkenazi and Ido kringel and Yaniv Tocker and Tal Furman Shohet},
journal= {arXiv preprint arXiv:2501.00356},
year = {2025}
}