中文

SecureNet:DeBERTa与大语言模型在网络钓鱼检测中的比较研究

密码学与安全 2025-02-10 v1 计算与语言 机器学习

摘要

网络钓鱼,无论是通过电子邮件、短信还是恶意网站,都通过利用社会工程学诱骗用户泄露敏感信息,对组织构成重大威胁。它不仅危及公司的数据安全,还会造成巨大的经济损失。在本文中,我们研究了大语言模型(LLM)的卓越性能是否可以被利用于特定任务,如文本分类,特别是检测恶意内容,并将其结果与最先进的Deberta V3(使用ELECTRA风格预训练与梯度解缠嵌入共享的DeBERTa)模型进行比较。我们使用包含电子邮件、HTML、URL、短信和合成数据生成等多种数据来源的全面公开数据集,系统地评估了两种方法的潜力和局限性。此外,我们展示了LLM如何生成令人信服的网络钓鱼电子邮件,使识别诈骗变得更加困难,并在此背景下评估了两种模型的性能。我们的研究进一步深入探讨了DeBERTa V3在其训练阶段、微调方法和迁移学习过程中遇到的挑战。同样,我们考察了与LLM相关的挑战,并评估了它们各自的性能。在我们的实验方法中,基于Transformer的DeBERTa方法最为有效,在测试数据集(HuggingFace网络钓鱼数据集)上实现了95.17%的召回率(灵敏度),紧随其后的是GPT-4,召回率为91.04%。我们使用其他数据集对训练好的DeBERTa V3模型和LLM(如GPT 4和Gemini 1.5)进行了额外实验。基于我们的发现,我们为这些先进语言模型的有效性和鲁棒性提供了宝贵的见解,并提供了详细的比较分析,可为未来加强网络安全措施以检测和缓解网络钓鱼威胁的研究工作提供参考。

关键词

引用

@article{arxiv.2406.06663,
  title  = {SecureNet: A Comparative Study of DeBERTa and Large Language Models for Phishing Detection},
  author = {Sakshi Mahendru and Tejul Pandit},
  journal= {arXiv preprint arXiv:2406.06663},
  year   = {2025}
}

备注

Preprint. 10 pages, Accepted in IEEE 7th International Conference on Big Data and Artificial Intelligence (BDAI 2024)