使用孪生神经网络检测同形字攻击
密码学与安全
2018-05-25 v1
摘要
同形字(名称欺骗)攻击是攻击者用来混淆文件和域名的一种常见技术。该技术创建在视觉上与合法且被识别的名称相似的进程或域名。例如,攻击者可能创建名为 svch0st.exe 的恶意软件,使得在目视检查运行中的进程或目录列表时,该进程或文件名可能被误认为 Windows 系统进程 svchost.exe。已发表的关于检测同形字攻击的研究十分有限。当前方法依赖字符串比较算法(如 Levenshtein 距离),导致计算繁重且假阳性数量高。此外,可用于可复现研究的公开数据集数量不足,且大多数数据集聚焦于网络钓鱼攻击,其中并非总是使用同形字。本文使用孪生卷积神经网络(CNN)提出了一种根本不同的解决方案。该技术不是利用基于字符替换和删除的相似性,而是使用渲染为图像的字符串上的学习度量:CNN 学习经过优化以检测渲染字符串视觉相似性的特征。训练好的模型用于将数千个潜在目标进程或域名转换为特征向量。这些特征向量使用随机化 KD-Tree 建立索引,使得相似性搜索极其快速且计算处理最小。该技术在受试者工作特征曲线下面积(ROC AUC)方面比基线技术有 13% 到 45% 的显著提升。此外,我们提供了代码和数据以促进未来研究。
引用
@article{arxiv.1805.09738,
title = {Detecting Homoglyph Attacks with a Siamese Neural Network},
author = {Jonathan Woodbridge and Hyrum S. Anderson and Anjum Ahuja and Daniel Grant},
journal= {arXiv preprint arXiv:1805.09738},
year = {2018}
}