利用可解释性生成面向恶意软件分类器的端到端对抗样本
密码学与安全
2022-06-02 v2
摘要
近年来,可解释机器学习(ML)主题已被广泛研究。迄今为止,该研究聚焦于常规 ML 用户的用例,例如调试 ML 模型。本文采取不同立场,表明攻击者可利用可解释 ML 绕过多特征类型恶意软件分类器。先前针对此类分类器的对抗攻击仅添加新特征而不修改已有特征,以避免损害被修改恶意软件可执行文件的功能。当前攻击使用单一算法,既盲目选择要修改的特征又盲目修改它们,将所有特征同等对待。本文中,我们提出一种不同方法。我们将对抗样本生成任务拆分为两部分:首先利用可解释性算法找出特定样本所有特征的重要性,随后逐特征进行特征特定的修改。为在黑盒场景中应用我们的攻击,我们引入可解释性可迁移性的概念,即对不同分类器(使用不同特征子集且在不同数据集上训练)应用可解释性算法,仍得到相似的重要特征子集。我们得出结论:可解释性算法可被攻击者利用,因此倡导训练更具可解释性分类器者应考虑此类分类器对对抗攻击更高脆弱性的权衡。
引用
@article{arxiv.2009.13243,
title = {Generating End-to-End Adversarial Examples for Malware Classifiers Using Explainability},
author = {Ishai Rosenberg and Shai Meir and Jonathan Berrebi and Ilay Gordon and Guillaume Sicard and Eli David},
journal= {arXiv preprint arXiv:2009.13243},
year = {2022}
}
备注
Accepted as a conference paper at IJCNN 2020