PhishGAN:同形字攻击的数据增强与识别
计算机视觉与模式识别
2021-01-11 v3 密码学与安全
机器学习
摘要
同形字(homoglyph)攻击是黑客用于实施钓鱼的常见技术。通过 punycode 创建与真实域名或链接视觉相似的域名或链接以混淆攻击,使受害者更易遭受钓鱼。例如,受害者可能将“|inkedin.com”误认为“linkedin.com”,并在此过程中向虚假网站泄露个人详情。当前最先进(SOTA)方法通常使用字符串比较算法(如 Levenshtein 距离),其计算开销大。原因之一缺乏公开可用数据集,从而阻碍了更先进机器学习(ML)模型的训练。此外,没有任何一种字体能够正确渲染所有类型的 punycode,这对创建不偏向任何特定字体的数据集提出了重大挑战。这一点加上海量的互联网域名,对创建能够涵盖所有可能变体的数据集构成了挑战。在此,我们展示条件生成对抗网络(GAN)——PhishGAN 如何用于生成同形字图像,并以非同形字输入文本图像为条件。为促成更多样化同形文本图像的生成,需要对当前 SOTA 进行实际改动。我们还展示了一个工作流,说明 PhishGAN 与同形字识别器(HI)模型如何联合用于识别该同形字试图模仿的域名。此外,我们展示了 PhishGAN 即时生成数据集的能力如何促进网络安全系统快速适应以检测新出现的威胁。
引用
@article{arxiv.2006.13742,
title = {PhishGAN: Data Augmentation and Identification of Homoglpyh Attacks},
author = {Joon Sern Lee and Gui Peng David Yam and Jin Hao Chan},
journal= {arXiv preprint arXiv:2006.13742},
year = {2021}
}
备注
8 pages, 8 figures