面向恶意 URL 检测与网页分类的连续多任务预训练
密码学与安全
2025-05-27 v2 机器学习
摘要
恶意 URL 检测与网页分类是网络安全和信息管理中的关键任务。近年来,大量研究探索使用 BERT 或类似语言模型取代传统机器学习方法,以检测恶意 URL 并对网页进行分类。尽管先前的研究显示出了令人鼓舞的结果,但它们往往直接将现有语言模型应用于这些任务,而未考虑领域数据的固有差异(例如,与文本相比,URL 结构松散且语义稀疏),因此仍有性能提升空间。此外,当前方法侧重于单任务,尚未在多任务场景中进行测试。为应对这些挑战,我们提出了 urlBERT,这是一种利用 Transformer 从数十亿无标签 URL 中编码基础知识的预训练 URL 编码器。为实现这一目标,我们提出了五种无监督预训练任务,以捕捉 URL 词汇、语法和语义的多层次信息,并生成对比表示和对抗表示。此外,为避免预训练任务间的竞争与干扰,我们提出了一种分组顺序学习方法,以确保多任务间的有效训练。最后,我们利用两阶段微调方法来提高任务模型的训练稳定性和效率。为评估 urlBERT 的多任务潜力,我们分别在单任务和多任务模式下对任务模型进行了微调。前者为单一任务创建分类模型,后者则构建能够处理多个任务的分类模型。我们在三个下游任务上评估了 urlBERT:钓鱼 URL 检测、广告 URL 检测和网页分类。结果表明,urlBERT 优于标准预训练模型,且其多任务模式能够满足现实世界对多任务处理的需求。
引用
@article{arxiv.2402.11495,
title = {Continuous Multi-Task Pre-training for Malicious URL Detection and Webpage Classification},
author = {Yujie Li and Yiwei Liu and Peiyue Li and Yifan Jia and Yanbin Wang},
journal= {arXiv preprint arXiv:2402.11495},
year = {2025}
}