中文

用于网络钓鱼检测、自一致性、忠实性和可解释性的大语言模型评估

密码学与安全 2025-06-17 v1 人工智能 机器学习

摘要

网络钓鱼攻击仍然是最普遍且持续存在的网络安全威胁之一,攻击者不断演变和加剧其策略以规避通用检测系统。尽管人工智能和机器学习取得了重大进展,但忠实再现支撑网络钓鱼判断的可解释推理、分类和可解释性仍然具有挑战性。由于自然语言处理领域的最新进展,大语言模型(LLM)在改进领域特定的网络钓鱼分类任务方面展现出有前景的方向和潜力。然而,增强分类模型的可靠性和鲁棒性不仅需要 LLM 的准确预测,还需要与预测一致且可信的解释。因此,一个关键问题是:LLM 是否不仅能准确分类网络钓鱼邮件,还能生成与其预测可靠对齐且内部自一致的解释?为回答这些问题,我们微调了基于 Transformer 的模型,包括 BERT、Llama 模型和 Wizard,以提高领域相关性并使其更适应网络钓鱼特有的区分,使用二元序列分类、对比学习(CL)和直接偏好优化(DPO)。为此,我们通过基于 SHAPley 值的 ConsistenCy 度量(CC SHAP)评估了它们在网络钓鱼分类和可解释性方面的表现,该度量衡量预测解释标记对齐程度,以测试模型的内部忠实性和一致性,并揭示其预测和推理背后的原因。总体而言,我们的结果表明,尽管 Llama 模型缺乏可靠的决策准确性,但其展现出更强的预测解释标记对齐和更高的 CC SHAP 分数,而 Wizard 取得了更好的预测准确性但较低的 CC SHAP 分数。

关键词

引用

@article{arxiv.2506.13746,
  title  = {Evaluating Large Language Models for Phishing Detection, Self-Consistency, Faithfulness, and Explainability},
  author = {Shova Kuikel and Aritran Piplai and Palvi Aggarwal},
  journal= {arXiv preprint arXiv:2506.13746},
  year   = {2025}
}