超越 Transcend:概念漂移下的恶意软件分类再探
摘要
用于恶意软件分类的机器学习展现出令人鼓舞的结果,但真实部署中,随着恶意软件作者调整技术以规避检测,性能会下降。这种现象被称为概念漂移,随着新恶意软件样本不断演化,它们与原始训练样本越来越不像。应对概念漂移的一种有前景的方法是带拒绝的分类,即那些很可能被误分类的样本被隔离,直到可由专家分析。我们提出 TRANSCENDENT,一个基于 Transcend 构建的拒绝框架,Transcend 是近期提出的基于保角预测理论的策略。特别地,我们对 Transcend 进行了形式化处理,使我们能够精炼其底层统计引擎——保角评估理论,并更好地理解其有效性的理论原因。在此过程中,我们开发了另外两个保角评估器,其性能匹配或超越原方法,同时显著降低了计算开销。我们在跨越 5 年的恶意软件数据集上评估 TRANSCENDENT,该数据集去除了原始评估中存在的实验偏差来源。TRANSCENDENT 优于最先进的方法,同时能泛化到不同恶意软件领域和分类器。为进一步协助从业者,我们确定了 TRANSCENDENT 部署的最优操作设置,并展示其如何应用于许多流行的学习算法。这些见解支持了新旧经验发现,使 Transcend 首次成为可靠且实用的解决方案。为此,我们将 TRANSCENDENT 开源,以帮助安全社区采用拒绝策略。
引用
@article{arxiv.2010.03856,
title = {Transcending Transcend: Revisiting Malware Classification in the Presence of Concept Drift},
author = {Federico Barbero and Feargus Pendlebury and Fabio Pierazzi and Lorenzo Cavallaro},
journal= {arXiv preprint arXiv:2010.03856},
year = {2024}
}
备注
Version accepted at IEEE Symposium on Security & Privacy (Oakland), 2022. Errata Corrige to the published version: https://s2lab.cs.ucl.ac.uk/downloads/transcending-errata_corrige.pdf. Project Website: https://s2lab.cs.ucl.ac.uk/projects/transcend/