中文

诊断微调大语言模型的泛化失败:一项关于钓鱼检测的跨架构研究

人工智能 2026-01-16 v1

摘要

微调大语言模型(LLMs)在专门任务上取得了最先进的性能,然而诊断这些模型为何变得脆弱且无法泛化仍然是一个关键且悬而未决的问题。为此,我们引入并应用了一个多层诊断框架进行跨架构研究。我们在一个高风险的钓鱼检测任务上微调了Llama 3.1 8B、Gemma 2 9B和Mistral模型,并使用SHAP分析和机制可解释性来揭示其泛化失败的根本原因。我们的研究揭示了三个关键发现:(1)泛化由架构与数据多样性之间的强大协同作用驱动。Gemma 2 9B模型实现了最先进的性能(F1分数>91%),但仅在风格多样的“通才”数据集上训练时才能达到。(2)泛化高度依赖于架构。我们诊断了Llama 3.1 8B中的一个特定失败模式,该模型在狭窄领域表现良好,但无法整合多样化的数据,导致性能显著下降。(3)某些架构天生更具泛化能力。Mistral模型在多种训练范式下被证明是一个稳定且富有韧性的执行者。通过精确定位导致这些失败的有缺陷的启发式方法,我们的工作为诊断和理解泛化失败提供了一种具体的方法论,强调了可靠的人工智能需要深入验证架构、数据和训练策略之间的相互作用。

关键词

引用

@article{arxiv.2601.10524,
  title  = {Diagnosing Generalization Failures in Fine-Tuned LLMs: A Cross-Architectural Study on Phishing Detection},
  author = {Frank Bobe and Gregory D. Vetaw and Chase Pavlick and Darshan Bryner and Matthew Cook and Jose Salas-Vernis},
  journal= {arXiv preprint arXiv:2601.10524},
  year   = {2026}
}

备注

16 pages, 6 figures, 6 tables