E-PhishGen:解锁钓鱼邮件检测的新研究
密码学与安全
2025-09-16 v2 人工智能
摘要
每天,我们的收件箱里充斥着未经请求的电子邮件,从令人厌烦的垃圾邮件到更隐蔽的钓鱼骗局。遗憾的是,尽管此前已有大量研究提出实现近乎完美准确率的解决方案,但现实情况是,对抗恶意电子邮件仍然是一个未解决的难题。这篇“开放问题”论文对钓鱼邮件检测领域的科学工作进行了批判性评估。首先,我们关注用于评估研究中提出的方法的基准数据集。我们发现,大多数先前的工作依赖于包含我们认为不能代表当前趋势且大多为英语的电子邮件数据集。基于这一发现,我们随后重新实现并重新评估了多种依赖机器学习(ML)的检测方法,包括大语言模型(LLM),并发布了我们所有的代码库——这在相关研究中是一种(遗憾的是)不常见的做法。我们表明,当在相同数据集上进行训练和测试时,大多数此类方法都能实现近乎完美的性能——这一结果本质上阻碍了发展(未来的研究如何能超越已经近乎完美的方法?)。为了促进创建反映当前钓鱼趋势的“更具挑战性的基准”,我们提出了 E-PhishGEN,一个基于 LLM(且注重隐私保护)的框架,用于生成新型钓鱼邮件数据集。我们使用 E-PhishGEN 创建了 E-PhishLLM,这是一个包含三种语言共 16616 封电子邮件的新型钓鱼邮件检测数据集。我们使用 E-PhishLLM 来测试我们考虑的检测器,结果显示其性能远低于在现有基准上取得的性能——表明有更大的改进空间。我们还通过用户研究(n=30)验证了 E-PhishLLM 的质量。总而言之,我们表明钓鱼邮件检测仍然是一个开放问题,并为未来研究解决此类问题提供了手段。
引用
@article{arxiv.2509.01791,
title = {E-PhishGen: Unlocking Novel Research in Phishing Email Detection},
author = {Luca Pajola and Eugenio Caripoti and Stefan Banzer and Simeone Pizzi and Mauro Conti and Giovanni Apruzzese},
journal= {arXiv preprint arXiv:2509.01791},
year = {2025}
}
备注
Accepted to ACM AISec '25