基于深度强化学习增强 NOP 指令插入以混淆恶意软件
密码学与安全
2022-06-14 v1
摘要
当前应对恶意软件检测与分类问题的最先进研究集中于设计、实现和部署由机器学习驱动的系统,因其能泛化至前所未见的恶意软件家族及多态变异。然而,已有研究表明机器学习模型(特别是深度神经网络)对精心构造的输入(对抗样本)缺乏鲁棒性。本工作中,我们研究了最先进的浅层卷积神经网络恶意软件分类器针对死代码插入技术的脆弱性。我们提出了一种由 Double Q-network 驱动的通用框架,以诱导对恶意软件家族的误分类。该框架通过卷积神经网络训练智能体,在代码序列中选择最优位置插入死代码指令,使机器学习分类器对所得可执行文件错误标注。实验表明,所提方法将分类器的分类准确率显著降至 56.53%,同时对属于 Kelihos_ver3、Simda 和 Kelihos_ver1 家族的样本达到 100% 的规避率。此外,与随机智能体相比,误标注恶意软件所需的平均指令数减少了 33%。
引用
@article{arxiv.2111.09626,
title = {Enhancing the Insertion of NOP Instructions to Obfuscate Malware via Deep Reinforcement Learning},
author = {Daniel Gibert and Matt Fredrikson and Carles Mateu and Jordi Planes and Quan Le},
journal= {arXiv preprint arXiv:2111.09626},
year = {2022}
}