URLNet:基于深度学习的 URL 表示学习用于恶意 URL 检测
密码学与安全
2018-03-05 v2 机器学习
摘要
恶意 URL 托管非请求内容并被用于实施网络犯罪。及时检测它们至关重要。传统上,这通过黑名单实现,但黑名单无法穷尽,且无法检测新生成的恶意 URL。为此,近年来出现了若干利用机器学习进行恶意 URL 检测的努力。最流行且可扩展的方法通过提取词袋类特征来利用 URL 字符串的词汇属性,随后应用如 SVM 等机器学习模型。也有专家设计的其他特征以提升模型的预测性能。这些方法存在若干局限:(i) 无法有效捕获 URL 字符串中的语义含义与序列模式;(ii) 需要大量人工特征工程;(iii) 无法处理未见特征并泛化到测试数据。为应对这些挑战,我们提出 URLNet,一种端到端深度学习框架,直接从 URL 学习用于恶意 URL 检测的非线性 URL 嵌入。具体而言,我们将卷积神经网络应用于 URL 字符串的字符与单词,在联合优化框架中学习 URL 嵌入。该方法使模型能够捕获多种语义信息,这是现有模型无法做到的。我们还提出进阶词嵌入以解决该任务中观察到的过多罕见词问题。我们在大规模数据集上进行了广泛实验,并显示出相较现有方法的显著性能提升。我们还进行了消融研究以评估 URLNet 各组件的性能。
引用
@article{arxiv.1802.03162,
title = {URLNet: Learning a URL Representation with Deep Learning for Malicious URL Detection},
author = {Hung Le and Quang Pham and Doyen Sahoo and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:1802.03162},
year = {2018}
}