中文

模型效用定律:通过机制可解释性指标超越性能评估大语言模型

计算与语言 2025-05-27 v3

摘要

大语言模型(LLMs)已成为学术界、工业界与日常应用中不可或缺的工具,但当前的评估方法难以跟上其快速发展步伐。大语言模型时代评估的一个核心挑战是泛化问题:如何从不可避免有限的基准测试中推断出模型近乎无限的能力。为应对这一挑战,我们提出了模型利用指数(MUI),这是一种结合机制可解释性的增强指标,可补充传统的性能评分。MUI量化了模型在任务上所付出的努力,定义为推理过程中被激活的神经元或特征所占的比例。直观而言,一个真正有能力的模型应以更少的努力取得更高的性能。在多个主流LLMs上的大量实验揭示了MUI与性能之间存在一致的反比对数关系,我们将其表述为效用定律(Utility Law)。基于该定律,我们推导出四个实用推论,分别用于:(i)指导训练诊断,(ii)暴露数据污染问题,(iii)实现更公平的模型比较,(iv)设计针对特定模型的数据集多样性。代码可在 https://github.com/ALEX-nlp/MUI-Eva 获取。

关键词

引用

@article{arxiv.2504.07440,
  title  = {Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric},
  author = {Yixin Cao and Jiahao Ying and Yaoning Wang and Xipeng Qiu and Xuanjing Huang and Yugang Jiang},
  journal= {arXiv preprint arXiv:2504.07440},
  year   = {2025}
}