HTMLPhish:通过对 HTML 分析应用深度学习技术实现钓鱼网页检测
密码学与安全
2020-11-09 v3 计算与语言
机器学习
机器学习
摘要
近来,钓鱼攻击的开发与实施几乎不需要技术技巧与成本。这一趋势导致万维网上钓鱼攻击数量不断增长。因此,主动对抗钓鱼攻击的技术已变得极为必要。本文提出 HTMLPhish,一种基于深度学习的、数据驱动的端到端自动钓鱼网页分类方法。具体而言,HTMLPhish 接收网页 HTML 文档的内容,并采用卷积神经网络(CNNs)来学习 HTML 文本内容的语义依赖关系。CNNs 从 HTML 文档嵌入中习得恰当的特征表示,而无需大量人工特征工程。此外,我们所提出的词嵌入与字符嵌入拼接方法使模型能够处理新特征,并确保对测试数据的轻松外推。我们在超过 50,000 份 HTML 文档的数据集上进行了综合实验,该数据集提供了现实世界中钓鱼与良性网页的可获取分布,取得了超过 93% 的准确率与真正率。同时,HTMLPhish 是一种完全语言无关且客户端的策略,因而可无视文本语言进行网页钓鱼检测。
引用
@article{arxiv.1909.01135,
title = {HTMLPhish: Enabling Phishing Web Page Detection by Applying Deep Learning Techniques on HTML Analysis},
author = {Chidimma Opara and Bo Wei and Yingke Chen},
journal= {arXiv preprint arXiv:1909.01135},
year = {2020}
}