DRLDO:一种基于深度强化学习的新型去混淆系统以防御变形恶意软件
密码学与安全
2021-02-02 v1 人工智能
机器学习
摘要
本文提出一种新机制,在 opcode 级别将变形与混淆恶意软件归一化,从而构建先进的变形恶意软件去混淆与防御系统。我们将其命名为DRLDO,即基于深度强化学习的去混淆器(Deep Reinforcement Learning based De-Obfuscator)。将DRLDO作为子组件嵌入,现有入侵检测系统可增强对来自现有恶意软件混淆及变形变种的“零日”攻击的防御能力。这十分重要:不仅因迄今无系统使用先进DRL智能且自动地将混淆归一化至 opcode 级别,也因DRLDO不要求改动现有IDS。DRLDO甚至不要求IDS的分类器用含混淆样本的新数据集重新训练。故DRLDO可轻松改装至任何现有IDS部署中。我们设计、开发并实验评估该系统,针对来自含多代恶意软件标准数据集的样本经混淆生成的多次同步攻击。实验结果证明,DRLDO成功使原本不可检测的混淆变种被现有预训练恶意软件分类器检出。检测概率被提升至0.6的明确 cutoff 以上,使分类器无误检混淆恶意软件。此外,DRLDO生成的去混淆变种与基础恶意软件相关性极高(0.99)。该观察证实DRLDO确在学习去混淆而非利用琐碎技巧。
引用
@article{arxiv.2102.00898,
title = {DRLDO: A novel DRL based De-ObfuscationSystem for Defense against Metamorphic Malware},
author = {Mohit Sewak and Sanjay K. Sahay and Hemant Rathore},
journal= {arXiv preprint arXiv:2102.00898},
year = {2021}
}