中文

GlyphNet:同形异义域名数据集及基于注意力卷积神经网络的检测

密码学与安全 2023-06-21 v1 机器学习

摘要

网络攻击欺骗机器相信原本不存在之物。然而,有些攻击连人类也会上当。多年来攻击者利用以 exploit 视觉漏洞的一种著名攻击被称为同形异义字符(homoglyph)攻击。它采用一种基础却有效的机制来创建难以与合法域名区分的非法域名。此外,由于差异对用户而言极难察觉,他们无法克制自己不去点击这些同形异义域名。在许多情况下,这会导致信息窃取或系统上的恶意软件攻击。现有方法使用应用于主要基于语言任务的简单、基于字符串的比较技术。尽管它们在一定程度上有效,但通常失败,因为它们对不同类型同形异义字符不够鲁棒,且由于时间需求与字符串长度成正比而在计算上不可行。类似地,基于神经网络的方法被用于区分真实域名字符串与伪造字符串。然而,两种方法的问题在于它们都需要配对的真实与伪造域名字符串序列才能工作,而现实中往往并非如此,因为攻击者仅向易受攻击的用户发送非法或同形异义域名。因此,现有方法不适用于现实世界中的实际场景。在我们的工作中,我们创建了 GlyphNet,一个包含 4M 个域名(真实与同形异义均有)的图像数据集。此外,我们引入了一种使用基于注意力的卷积神经网络的同形异义攻击检测系统基线方法。我们表明我们的模型能在我们的数据集上以 0.93 的 AUC 达到检测同形异义攻击的 SOTA 精度。

关键词

引用

@article{arxiv.2306.10392,
  title  = {GlyphNet: Homoglyph domains dataset and detection using attention-based Convolutional Neural Networks},
  author = {Akshat Gupta and Laxman Singh Tomar and Ridhima Garg},
  journal= {arXiv preprint arXiv:2306.10392},
  year   = {2023}
}