中文

大语言模型及其在垃圾邮件检测中的漏洞调查

密码学与安全 2025-04-15 v1

摘要

垃圾邮件持续构成数字用户的重大挑战,填充收件箱并构成安全风险。传统垃圾邮件检测方法,包括基于规则的、协同的和机器学习方法,难以跟上垃圾信息生成者所采用的快速演化战术。该项目研究新的垃圾邮件检测系统,这些系统利用大语言模型(LLM)通过垃圾数据集进行微调。更重要的是,我们想了解基于 LLM 的垃圾邮件检测系统在针对 purposefully 修改垃圾邮件的对抗攻击以及利用训练数据与检测消息差异进行数据污染攻击时表现如何,后者暴露了传统机器学习模型容易受攻击的漏洞。该实验采用 GPT2 和 BERT 两个 LLM 模型,以及 Enron、LingSpam 和 SMSspamCollection 三个垃圾数据集进行大规模训练和测试。结果表明,尽管它们可以作为有效的垃圾邮件过滤器,LLM 模型仍然容易受到对抗和数据污染攻击。该研究为未来 LLM 模型在信息安全领域的应用提供了非常有用的见解。

关键词

引用

@article{arxiv.2504.09776,
  title  = {An Investigation of Large Language Models and Their Vulnerabilities in Spam Detection},
  author = {Qiyao Tang and Xiangyang Li},
  journal= {arXiv preprint arXiv:2504.09776},
  year   = {2025}
}

备注

10 pages; presented at HotSoS'2025 as a work in progress paper