中文

对大规模语言模型评估结果的全面再评估:一种多层面统计方法

计算与语言 2024-06-25 v2 人工智能 机器学习

摘要

在大型语言模型(LLMs)快速演进的背景下,评估对于理解和推动这些模型发展的重要性日益凸显。评估已揭示,诸如规模扩展、训练类型、架构等因素深刻影响着 LLMs 的性能。然而,这些影响的程度和性质仍是争论的话题,因为大多数评估仅限于有限数量的模型和数据点。通过统计视角可以更有效地阐明这些因素对性能分数的影响。我们的研究针对当前评估方法的不足,对这些 LLMs 进行了彻底的再检验。随着统一评估框架的出现,我们的研究利用了广泛的评估结果数据集,引入了一套全面的统计方法。这包括应用方差分析(ANOVA)、Tukey HSD 检验、广义加性混合模型(GAMM)和聚类技术,为解读 LLM 性能数据提供了一种稳健且透明的方法。与主流发现相反,我们的结果挑战了关于涌现能力以及特定训练类型和架构在 LLMs 中影响的假设。这些发现为 LLMs 的特性、内在本质和发展轨迹提供了新的视角。通过提供直接且可靠的方法来审视和再评估 LLM 性能数据,本研究对 LLM 的效率和潜力贡献了细致入微的见解。

关键词

引用

@article{arxiv.2403.15250,
  title  = {Comprehensive Reassessment of Large-Scale Evaluation Outcomes in LLMs: A Multifaceted Statistical Approach},
  author = {Kun Sun and Rong Wang and Anders Søgaard},
  journal= {arXiv preprint arXiv:2403.15250},
  year   = {2024}
}