中文

基于上下文敏感词嵌入的域名生成算法在线检测

密码学与安全 2019-01-29 v1 计算与语言 机器学习 网络与互联网体系结构

摘要

域名生成算法(DGAs)常被恶意软件用来生成用于连接命令与控制(C2)服务器的域名。近期DGA检测工作利用卷积神经网络(CNNs)和字符级长短期记忆网络(LSTMs)等深度学习架构对域名进行分类。然而,这些分类器在基于词表的DGA家族上表现不佳,此类家族通过伪随机拼接字典词生成域名。我们提出了一种新方法,将上下文敏感词嵌入与一个简单的全连接分类器相结合,基于词级信息对域名进行分类。词嵌入在大型无关语料上预训练,并在域名数据训练期间保持冻结。可训练参数的少量使得训练时间极短,而表示中存储的语言知识的迁移使得模型在小型训练数据集上也能高性能。我们表明,该架构仅用30个DGA训练样本就在基于词表的DGA家族上可靠优于现有技术,并在约100个DGA训练样本时达到最先进性能,同时所需训练时间比当前技术少一个数量级。特别值得注意的是该技术对matsnu DGA的性能:分类器在仅训练30个该DGA域名样本后以1:1,000误报率(FPR)达到89.5%检测率,在90个样本后以1:10,000 FPR达到91.2%检测率。考虑到其中一些DGA的词表有数百个词,我们的结果表明该技术不依赖于分类器学习DGA词表,而是能够学习基于词表的DGA家族的语义签名。

关键词

引用

@article{arxiv.1811.08705,
  title  = {Inline Detection of Domain Generation Algorithms with Context-Sensitive Word Embeddings},
  author = {Joewie J. Koh and Barton Rhodes},
  journal= {arXiv preprint arXiv:1811.08705},
  year   = {2019}
}

备注

6 pages, 5 figures, 2 tables