解释深度学习对对抗性恶意软件二进制的脆弱性
密码学与安全
2019-01-25 v2
摘要
近期研究表明,用于恶意软件检测的深度学习算法同样易受对抗样本的影响,即通过对输入恶意软件进行精心构造的扰动来实现误导性分类。尽管这已引发对其在该任务中适用性的质疑,但目前尚不清楚为何此类算法在这一特定应用领域中也容易被欺骗。在本文中,我们迈出解决该问题的第一步,利用为解释深度神经网络黑盒决策而开发的可解释机器学习算法。具体而言,我们采用一种称为特征归因的可解释技术来识别对每个决策贡献最大的输入特征,并对其进行调整以对恶意软件二进制的分类提供有意义的解释。在此情形下,我们发现一个近期提出的卷积神经网络并未从可执行文件的 data 与 text 节区中学习到任何用于恶意软件检测的有意义特征,而是倾向于基于文件头中存在的特征来区分良性样本与恶意软件样本。基于该发现,我们提出了一种新颖的攻击算法,仅通过修改文件头中数十个字节即可生成对抗性恶意软件二进制。相较于其他最先进的攻击算法,我们的攻击无需在文件末尾注入任何填充字节,且效率更高,因为所需操纵的字节数远少。
引用
@article{arxiv.1901.03583,
title = {Explaining Vulnerabilities of Deep Learning to Adversarial Malware Binaries},
author = {Luca Demetrio and Battista Biggio and Giovanni Lagorio and Fabio Roli and Alessandro Armando},
journal= {arXiv preprint arXiv:1901.03583},
year = {2019}
}