中文

一种用于快速、格式无关的恶意 Web 内容检测的深度学习方法

密码学与安全 2018-04-16 v1 机器学习 机器学习

摘要

恶意 Web 内容是当今互联网上的一个严重问题。在本文中,我们提出了一种用于检测恶意网页的深度学习方法。过去的 Web 内容检测工作依赖于语法解析或对 HTML 和 JavaScript 进行仿真来提取特征,而我们的方法直接对通过简单正则表达式直接从静态 HTML 文件中提取的与语言无关的标记流进行操作。这使其速度足以应用于防火墙和 Web 代理等高频数据场景,并使其能够避免复杂解析和仿真代码带来的攻击面暴露。与词袋模型等忽略空间信息的知名方法不同,我们的神经网络在分层空间尺度上检查内容,使我们的模型能够捕获局部性,与词袋模型基线相比获得了更高的准确率。我们提出的架构在 0.1% 的误报率下实现了 97.5% 的检测率,并在商用硬件上以每秒超过 100 个网页的速率对小批量网页进行分类。我们方法的速度和准确率使其适合部署到终端、防火墙和 Web 代理。

关键词

引用

@article{arxiv.1804.05020,
  title  = {A Deep Learning Approach to Fast, Format-Agnostic Detection of Malicious Web Content},
  author = {Joshua Saxe and Richard Harang and Cody Wild and Hillary Sanders},
  journal= {arXiv preprint arXiv:1804.05020},
  year   = {2018}
}