DeepDGA:对抗性调优的域名生成与检测
密码学与安全
2016-11-04 v1 人工智能
摘要
许多恶意软件家族利用域名生成算法(DGA)来建立命令与控制(C&C)连接。尽管有许多伪随机生成域名的方法,本文重点关注基于单个域名的检测(与生成),这为检测已知 DGA 家族提供了一种简单而灵活的手段。最近的机器学习方法在检测相当简单的 DGA 方面取得了成功,其中许多 DGA 生成固定长度的域名。然而,在有限数据集上训练的模型对新的 DGA 变体有些视而不见。在本文中,我们利用生成对抗网络的概念,构建了一个基于深度学习的 DGA,其设计目的是故意绕过基于深度学习的检测器。在一系列对抗回合中,生成器学习生成越来越难以检测的域名。相应地,检测器模型更新其参数以应对对抗生成的域名。我们检验了这样一个假设:对抗生成的域名是否可用于扩充训练集,以强化其他机器学习模型,使其能够应对尚未观测到的 DGA。我们详细说明了训练这个基于字符的生成对抗网络(GAN)所面临的若干挑战的解决方案。特别是,我们的深度学习架构最初是在 Alexa 排名前一百万的域名上训练的域名自编码器(编码器 + 解码器)。然后,编码器和解码器以竞争方式重组为一个生成对抗网络(检测器 + 生成器),并采用新颖的神经架构和训练策略来改善收敛性。
引用
@article{arxiv.1610.01969,
title = {DeepDGA: Adversarially-Tuned Domain Generation and Detection},
author = {Hyrum S. Anderson and Jonathan Woodbridge and Bobby Filar},
journal= {arXiv preprint arXiv:1610.01969},
year = {2016}
}