中文

通过捷径神经元分析建立可信的大语言模型评估

计算与语言 2025-06-05 v1

摘要

大语言模型(LLM)的发展依赖于可信的评估。然而,目前大多数评估依赖于公开基准,这些基准容易受到数据污染问题的影响,从而严重损害公平性。以往的研究侧重于构建动态基准来解决污染问题。然而,持续构建新基准成本高昂且具有周期性。在这项工作中,我们旨在通过分析受污染模型本身的机制来解决污染问题。通过实验,我们发现受污染模型的高估很可能是因为参数在训练中获得了捷径解。我们进一步提出了一种通过比较和因果分析来识别捷径神经元的新方法。在此基础上,我们引入了一种称为捷径神经元修补的评估方法,以抑制捷径神经元。实验验证了我们的方法在缓解污染方面的有效性。此外,我们的评估结果与最近发布的可信基准MixEval表现出强烈的线性相关性,Spearman系数(ρ\rho)超过0.95。这种高相关性表明我们的方法能够紧密揭示模型的真实能力,并且是可信的。我们进行了进一步的实验,以证明我们的方法在各种基准和超参数设置下的泛化性。代码:https://github.com/GaryStack/Trustworthy-Evaluation

关键词

引用

@article{arxiv.2506.04142,
  title  = {Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis},
  author = {Kejian Zhu and Shangqing Tu and Zhuoran Jin and Lei Hou and Juanzi Li and Jun Zhao},
  journal= {arXiv preprint arXiv:2506.04142},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main Conference