一种用于快速、格式无关的恶意 Web 内容检测的深度学习方法
密码学与安全
2018-04-16 v1 机器学习
机器学习
摘要
恶意 Web 内容是当今互联网上的一个严重问题。在本文中,我们提出了一种用于检测恶意网页的深度学习方法。过去的 Web 内容检测工作依赖于语法解析或对 HTML 和 JavaScript 进行仿真来提取特征,而我们的方法直接对通过简单正则表达式直接从静态 HTML 文件中提取的与语言无关的标记流进行操作。这使其速度足以应用于防火墙和 Web 代理等高频数据场景,并使其能够避免复杂解析和仿真代码带来的攻击面暴露。与词袋模型等忽略空间信息的知名方法不同,我们的神经网络在分层空间尺度上检查内容,使我们的模型能够捕获局部性,与词袋模型基线相比获得了更高的准确率。我们提出的架构在 0.1% 的误报率下实现了 97.5% 的检测率,并在商用硬件上以每秒超过 100 个网页的速率对小批量网页进行分类。我们方法的速度和准确率使其适合部署到终端、防火墙和 Web 代理。
引用
@article{arxiv.1804.05020,
title = {A Deep Learning Approach to Fast, Format-Agnostic Detection of Malicious Web Content},
author = {Joshua Saxe and Richard Harang and Cody Wild and Hillary Sanders},
journal= {arXiv preprint arXiv:1804.05020},
year = {2018}
}