基于大语言模型的网络钓鱼邮件检测可信度校准框架
密码学与安全
2025-11-10 v1 人工智能
摘要
网络钓鱼邮件持续构成在线通信的挑战,Through realistic language and adaptive tactics, they exploit human trust and evade automated filters. 虽然大语言模型(LLM)如 GPT-4 和 LLaMA-3-8B 在文本分类中取得强大的准确率,但其在安全系统中的部署需要评估基准性能之外的可靠性。为此,本研究引入信任校准框架(TCF),一种用于评估网络钓鱼检测器的可重复方法,涵盖校准性、一致性和鲁棒性三个维度。将这些组件集成到受限指数(TCI)中,并配合衡量可信度跨数据集稳定性的交叉数据集稳定性(CDS)指标。实验使用 DeBERTa-v3-base、LLaMA-3-8B 和 GPT-4 在五个语料库上进行,包括 SecureMail 2025、Phishing Validation 2024、CSDMC2010、Enron-Spam 和 Nazario。结果显示 GPT-4 在整体可信度轮廓中表现最佳,随后是 LLaMA-3-8B 和 DeBERTa-v3-base。统计分析确认可靠性独立于原始准确率,凸显了面向实际部署的信任感知评估的重要性。该框架为评估 LLM 基于网络钓鱼检测中的模型可靠性建立了透明且可重复的基础。
引用
@article{arxiv.2511.04728,
title = {Trustworthiness Calibration Framework for Phishing Email Detection Using Large Language Models},
author = {Daniyal Ganiuly and Assel Smaiyl},
journal= {arXiv preprint arXiv:2511.04728},
year = {2025}
}
备注
10 pages, 5 figures