利用深度学习武器化统一码——基于弱标签数据识别同形字
密码学与安全
2020-12-23 v4 计算机视觉与模式识别
机器学习
摘要
视觉上相似的字符,或称同形字,可用于实施社会工程学攻击或规避垃圾邮件与剽窃检测器。因此,理解攻击者识别同形字(尤其是先前未被发现的同形字)并利用其发动攻击的能力十分重要。我们研究了一种采用嵌入学习、迁移学习与数据增强的深度学习模型,用以判定字符的视觉相似度从而识别潜在同形字。我们的方法独特地利用了由“大多数字符并非同形字”这一事实产生的弱标签。在成对同形字识别上,我们的模型大幅优于归一化压缩距离方法,取得了0.97的平均精度。我们还首次尝试将同形字聚类为等价类集合,这比成对信息更高效,便于安全从业者快速查找同形字或规范化易混淆字符串编码。为衡量聚类性能,我们提出了一种基于经典交并比(IOU)度量的指标(mBIOU)。我们的聚类方法取得了0.592的mBIOU,而朴素基线仅为0.430。我们还用模型预测了超过8000个先前未知的同形字,并发现其中许多可能为真正例的良好早期迹象。源代码与预测同形字列表已上传至Github:https://github.com/PerryXDeng/weaponizing_unicode
引用
@article{arxiv.2010.04382,
title = {Weaponizing Unicodes with Deep Learning -- Identifying Homoglyphs with Weakly Labeled Data},
author = {Perry Deng and Cooper Linsky and Matthew Wright},
journal= {arXiv preprint arXiv:2010.04382},
year = {2020}
}
备注
Updated DOI