中文

URL2Graph++:用于恶意URL检测的统一语义-结构-字符学习

密码学与安全 2025-09-15 v1

摘要

恶意URL检测仍是网络安全领域的一项重大挑战,主要归因于两个因素:(1)互联网的指数级增长导致了URL的极大多样性,使得泛化检测日益困难;(2)攻击者越来越多地采用复杂的混淆技术来逃避检测。我们主张,从根本上应对这些挑战需要:(1)获取语义理解以改善在庞大且多样的URL集合上的泛化能力,以及(2)准确建模URL结构组成内的上下文关系。在本文中,我们提出了一种结合多粒度图学习与语义嵌入的新型恶意URL检测方法,以联合捕获语义、字符级和结构特征,从而实现鲁棒的URL分析。为了对URL内部的依赖关系进行建模,我们首先在子词级和字符级构建双粒度URL图,其中节点表示URL词元/字符,边编码共现关系。为了获得细粒度嵌入,我们使用字符级卷积网络初始化节点表示。随后,这两个图通过联合训练的图卷积网络进行处理,以学习一致的图级表示,使模型能够捕获反映共现模式和字符级依赖关系的互补结构特征。此外,我们采用BERT来提取URL的语义表示,以实现语义感知理解。最后,我们引入门控动态融合网络,将语义增强的BERT表示与联合优化的图向量相结合,进一步提升检测性能。我们在多个具有挑战性的维度上对所提方法进行了广泛评估。结果表明,我们的方法超越了SOTA性能,包括针对大型语言模型的性能。

关键词

引用

@article{arxiv.2509.10287,
  title  = {URL2Graph++: Unified Semantic-Structural-Character Learning for Malicious URL Detection},
  author = {Ye Tian and Yifan Jia and Yanbin Wang and Jianguo Sun and Zhiquan Liu and Xiaowen Ling},
  journal= {arXiv preprint arXiv:2509.10287},
  year   = {2025}
}