中文

TESSERACT:消除恶意软件分类中跨空间与时间的实验偏差

密码学与安全 2019-09-13 v4 机器学习

摘要

Android 恶意软件分类是一个已解决的问题吗?已发表的高达 0.99 的 F1 分数似乎留给我们很少的改进空间。在本文中,我们认为结果通常因两种普遍存在的实验偏差来源而被夸大:由不具真实世界部署代表性的训练与测试数据分布引起的“空间偏差”;以及由训练与测试集错误的时间划分导致不可能配置而引起的“时间偏差”。我们提出一组空间与时间约束用于实验设计,以消除这两类偏差。我们引入一种新指标来概括分类器在真实世界设定下的预期鲁棒性,并给出一种算法来调整其性能。最后,我们演示这如何使我们评估针对时间衰减的缓解策略(如主动学习)。我们已在 TESSERACT 中实现了我们的解决方案,这是一个用于在真实设定下比较恶意软件分类器的开源评估框架。我们使用 TESSERACT 在涵盖三年多的 129K 应用数据集上评估了文献中的三个 Android 恶意软件分类器。我们的评估确认了早先发表的结果存在偏差,同时也揭示了反直觉的性能,并表明适当调优可带来显著改进。

关键词

引用

@article{arxiv.1807.07838,
  title  = {TESSERACT: Eliminating Experimental Bias in Malware Classification across Space and Time},
  author = {Feargus Pendlebury and Fabio Pierazzi and Roberto Jordaney and Johannes Kinder and Lorenzo Cavallaro},
  journal= {arXiv preprint arXiv:1807.07838},
  year   = {2019}
}

备注

This arXiv version (v4) corresponds to the one published at USENIX Security Symposium 2019, with a fixed typo in Equation (4), which reported an extra normalization factor of (1/N). The results in the paper and the released implementation of the TESSERACT framework remain valid and correct as they rely on Python's numpy implementation of area under the curve