中文

训练鲁棒 PDF 恶意软件分类器研究

声音 2019-07-01 v2 机器学习 音频与语音处理 机器学习

摘要

尽管最先进的 PDF 恶意软件分类器可被训练至几乎完美的测试准确率(99%)与极低误报率(低于 0.1%),但已有研究表明即便是简单对手也能规避它们。一个具有实际用途的恶意软件分类器必须对规避攻击具有鲁棒性。然而,实现此种鲁棒性是一项极具挑战的任务。在本文中,我们迈出了训练具有可验证鲁棒性属性的鲁棒 PDF 恶意软件分类器的第一步。例如,一个鲁棒性属性可强制要求:无论向 PDF 恶意软件中插入多少来自良性文档的页面,分类器仍必须将其分类为恶意。我们展示了如何对恶意软件分类器相对于特定鲁棒性属性在最坏情形下的行为进行有效形式化验证。此外,我们发现训练满足形式化验证鲁棒性属性的分类器,可通过消除简单规避攻击来提高无界(即不受鲁棒性属性约束)攻击者的规避代价。具体而言,我们提出了一种作用于 PDF 树结构的距离度量,并指定了两类鲁棒性属性,包括子树插入与删除。我们利用最先进的可验证鲁棒训练方法构建鲁棒 PDF 恶意软件分类器。我们的结果表明,我们能在三个属性上达到 92.27% 的平均已验证鲁棒准确率,同时保持 99.74% 的准确率与 0.56% 的误报率。借助简单鲁棒性属性,我们的鲁棒模型在应对无限制白盒攻击时,比所有基线模型保持高 7% 的鲁棒准确率。此外,最先进的以及新的自适应进化攻击者需要高达 10 倍的 L0L_0 特征距离与 21 倍多的 PDF 基本变异(如插入与删除对象)才能规避我们的鲁棒模型,而基线模型则不需要。

关键词

引用

@article{arxiv.1904.03543,
  title  = {Spatio-Temporal Attention Pooling for Audio Scene Classification},
  author = {Huy Phan and Oliver Y. Chén and Lam Pham and Philipp Koch and Maarten De Vos and Ian McLoughlin and Alfred Mertins},
  journal= {arXiv preprint arXiv:1904.03543},
  year   = {2019}
}

备注

To appear at the 20th Annual Conference of the International Speech Communication Association (INTERSPEECH 2019)