中文

DNS错拼域名检测:一种基于数据分析与机器学习的方法

机器学习 2020-12-29 v1 网络与互联网体系结构

摘要

域名系统(DNS)是当前基于IP网络的关键组件,因为它是名称到IP解析的标准机制。然而,由于其缺乏数据完整性与来源认证过程,它易受多种攻击。其中一种攻击是错拼抢注(Typosquatting)。检测此类攻击尤为重要,因为它可能威胁企业机密并可用于窃取信息或实施欺诈。本文提出一种基于机器学习的方法以应对错拼抢注漏洞。为此,首先使用探索性数据分析以更好地理解从八个基于域名的提取特征中观察到的趋势。此外,提出了一种使用五种分类算法构建的基于多数投票的集成学习分类器,能够以高准确率检测可疑域名。进而,通过使用K-means聚类算法研究未标记数据集中的相同特征并应用所开发的集成学习分类器,对观察到的趋势进行了验证。结果表明,合法域名具有更短的域名长度与更少的唯一字符。此外,所开发的集成学习分类器在准确率、精确率与F值方面表现更优。进一步表明,在使用聚类时观察到相似趋势。然而,被识别为潜在可疑的域名数量较高。因此,应用集成学习分类器后结果显示,被识别为潜在可疑的域名数量减少了近五分之四,同时在特征统计方面仍保持相同趋势。

关键词

引用

@article{arxiv.2012.13604,
  title  = {DNS Typo-squatting Domain Detection: A Data Analytics & Machine Learning Based Approach},
  author = {Abdallah Moubayed and MohammadNoor Injadat and Abdallah Shami and Hanan Lutfiyya},
  journal= {arXiv preprint arXiv:2012.13604},
  year   = {2020}
}

备注

7 pages, 6 figures, 3 tables, published in 2018 IEEE Global Communications Conference (GLOBECOM)