中文

利用卷积神经网络检测恶意PDF文件

密码学与安全 2020-08-04 v2 机器学习

摘要

恶意PDF文件是计算机安全面临的最大威胁之一。为了检测它们,已有大量研究使用手工签名或基于人工特征提取的机器学习方法。这些方法既耗时,又需要大量的先验知识,并且特征列表必须随着每个新发现的漏洞而更新。在这项工作中,我们提出了一种新颖的算法,该算法在文件的字节级别上使用卷积神经网络(CNN)集成,无需任何手工特征。我们使用一个包含90000个在线可下载文件的数据集表明,我们的方法对PDF恶意软件保持了高检测率(94%),甚至能检测出大多数杀毒软件仍未发现的新恶意文件。利用我们CNN网络自动生成的特征,并应用聚类算法,我们还发现杀毒软件的标签与生成的聚类之间具有高度相似性。

关键词

引用

@article{arxiv.2007.12729,
  title  = {Detecting malicious PDF using CNN},
  author = {Raphael Fettaya and Yishay Mansour},
  journal= {arXiv preprint arXiv:2007.12729},
  year   = {2020}
}