中文

Paladin:以新型触发-标签范式防御大语言模型生成的钓鱼邮件

密码学与安全 2025-09-10 v1 人工智能

摘要

随着大语言模型的快速发展,其恶意使用的潜在威胁,尤其是在生成钓鱼内容方面,正变得日益普遍。利用大语言模型的能力,恶意用户可以合成没有拼写错误和其他易检测特征的钓鱼邮件。此外,此类模型可以生成特定主题的钓鱼信息,为目标领域定制内容,从而增加攻击成功的可能性。检测此类内容仍然是一个重大挑战,因为大语言模型生成的钓鱼邮件通常缺乏清晰或可区分的语言特征。因此,大多数现有的语义级检测方法难以可靠地识别它们。虽然某些基于大语言模型的检测方法已显示出前景,但它们计算成本高,且受限于底层语言模型的性能,使其不适用于大规模部署。在本工作中,我们旨在解决这一问题。我们提出了 Paladin,它利用多种插入策略将触发-标签关联嵌入到普通大语言模型中,将其转变为经过改造的大语言模型。当经过改造的大语言模型生成与钓鱼相关的内容时,它会自动包含可检测的标签,从而实现更简便的识别。基于隐式和显式触发与标签的设计,我们在工作中考虑了四种不同的场景。我们从隐蔽性、有效性和鲁棒性三个关键角度评估了我们的方法,并将其与现有的基线方法进行了比较。实验结果表明,我们的方法优于基线方法,在所有场景下均实现了超过 90% 的检测准确率。

关键词

引用

@article{arxiv.2509.07287,
  title  = {Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm},
  author = {Yan Pang and Wenlong Meng and Xiaojing Liao and Tianhao Wang},
  journal= {arXiv preprint arXiv:2509.07287},
  year   = {2025}
}

备注

20 pages