中文

BitAbuse:用于防御网络钓鱼攻击的视觉扰动文本数据集

密码学与安全 2025-02-11 v1 人工智能

摘要

网络钓鱼攻击常通过视觉扰动文本绕过安全系统。这些文本中的噪声充当了对抗性攻击,旨在欺骗语言模型,阻止其准确解读内容。然而,由于获取足够的钓鱼案例困难,先前研究使用的合成数据集中不包含真实案例。本研究提出了 BitAbuse 数据集,包含真实世界的钓鱼案例,以解决此前研究的局限性。该数据集总计包含 325,580 条视觉扰动文本。数据集的输入来自原始语料库,包括视觉扰动句子和通过人工扰动过程生成的句子。每条输入句子都标注了其对应的基准真值,即恢复后的非扰动版本。在本研究提出的数据集上训练的语言模型表现显著优于先前方法,准确率约为 96%。我们的分析揭示了真实案例与合成案例之间的显著差距,凸显了该数据集在构建可靠的恢复任务预训练模型方面的价值。我们发布了 BitAbuse 数据集,包含标注了视觉扰动的真实世界钓鱼案例,以支持对抗性攻击防御的未来研究。

关键词

引用

@article{arxiv.2502.05225,
  title  = {BitAbuse: A Dataset of Visually Perturbed Texts for Defending Phishing Attacks},
  author = {Hanyong Lee and Chaelyn Lee and Yongjae Lee and Jaesung Lee},
  journal= {arXiv preprint arXiv:2502.05225},
  year   = {2025}
}

备注

18 pages, To appear in the Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics 2025