中文

基于图注意力 LSTM 的恶意 URL 检测模型

密码学与安全 2025-10-21 v1 人工智能

摘要

恶意 URL 构成重大的安全风险,因为它们可用于网络钓鱼攻击、分发恶意软件,以及帮助攻击者篡改网站。黑名单检测方法无法识别新型或被混淆的 URL,因为它们依赖于预先存在的模式。本文提出一种名为 GNN-GAT-LSTM 的混合深度学习模型,将图神经网络(GNN)与图注意力网络(GAT)和长短期记忆网络(LSTM)相结合。该架构提取数据中结构和序列模式。模型通过将 URL 转换为图形的方式实现,这一过程将字符作为节点通过边相连。它应用 one-hot 编码来表示节点特征。该模型接收来自 651,191 个 URL 的训练和测试数据,这些 URL 被分类为良性、网络钓鱼、篡改和恶意软件类别。预处理阶段包括特征工程和数据平衡技术,这些技术解决了类别不平衡问题以增强模型学习。GNN-GAT-LSTM 模型通过其 0.9806 的测试准确率和 0.9804 的加权 F1 分数实现了卓越的性能。在大多数类别中,尤其是良性和篡改 URL 上,模型表现出优异的精确率和召回率。总体而言,该模型为检测恶意 URL 提供了一种高效且可扩展的系统,展示了在实际网络安全应用中的强大潜力。

关键词

引用

@article{arxiv.2510.15971,
  title  = {A Graph-Attentive LSTM Model for Malicious URL Detection},
  author = {Md. Ifthekhar Hossain and Kazi Abdullah Al Arafat and Bryce Shepard and Kayd Craig and Imtiaz Parvez},
  journal= {arXiv preprint arXiv:2510.15971},
  year   = {2025}
}

备注

Planned to be submitted