中文

每个字符都很重要:从漏洞到防御的钓鱼检测

密码学与安全 2025-09-26 v1 人工智能 计算与语言 机器学习

摘要

随着技术的进步,针对组织和个人钓鱼攻击正成为一个日益严重的威胁。现有的自动检测方法在检测新型钓鱼攻击时往往缺乏可解释性和鲁棒性。在这项工作中,我们研究了字符级深度学习模型在钓鱼检测中的有效性,该模型可以同时提供鲁棒性和可解释性。我们在自定义构建的邮件数据集上评估了三种适配为字符级操作的神经网络架构,即 CharCNN、CharGRU 和 CharBiLSTM。其性能在三种场景下进行分析:(i)标准训练和测试,(ii)标准训练和测试下的对抗攻击,以及(iii)使用对抗样本进行训练和测试。旨在开发一款浏览器扩展工具,我们在有限的计算资源下测试了所有模型。在该受限设置中,CharGRU 在所有场景下均表现出最佳性能。所有模型都易受对抗攻击,但对抗训练显著提升了其鲁棒性。此外,通过将梯度加权类激活映射(Grad-CAM)技术适配到字符级输入,我们能够可视化每封邮件的哪些部分影响了每个模型的决策。我们的开源代码和数据发布于 https://github.com/chipermaria/every-character-counts。

关键词

引用

@article{arxiv.2509.20589,
  title  = {Every Character Counts: From Vulnerability to Defense in Phishing Detection},
  author = {Maria Chiper and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2509.20589},
  year   = {2025}
}

备注

Accepted at ICTAI 2025