中文

PMANet:基于后训练语言模型引导的多级特征注意力网络的恶意 URL 检测

密码学与安全 2025-03-24 v2

摘要

恶意 URL 的泛滥使其检测对提升网络安全至关重要。尽管预训练语言模型展现出前景,现有方法在领域适应性、字符级信息以及局部-全局编码融合方面仍存在困难。为应对这些挑战,我们提出 PMANet,一种预训练语言模型引导的多级特征注意力网络。PMANet 采用包含三个自监督目标的后训练过程:掩码语言建模、噪声语言建模和领域判别,有效捕捉子词与字符级信息。它还包含分层表示模块和动态逐层注意力机制,用于从低到高各层级提取特征。此外,空间金字塔池化融合局部与全局特征。在包括小规模数据、类不平衡和对抗攻击的多样场景下的实验表明,PMANet 优于最先进模型,达到 0.9941 的 AUC,并在案例研究中正确检测出全部 20 个恶意 URL。代码与数据见 https://github.com/Alixyvtte/Malicious-URL-Detection-PMANet。

关键词

引用

@article{arxiv.2311.12372,
  title  = {PMANet: Malicious URL detection via post-trained language model guided multi-level feature attention network},
  author = {Ruitong Liu and Yanbin Wang and Haitao Xu and Zhan Qin and Fan Zhang and Yiwei Liu and Zheng Cao},
  journal= {arXiv preprint arXiv:2311.12372},
  year   = {2025}
}

备注

18 pages, 8 figures