中文

大语言模型基准测试的不足——生成式人工智能时代的挑战

人工智能 2025-05-15 v2 计算与语言 计算机与社会 人机交互

摘要

大语言模型(LLM)快速流行的趋势以及其新兴能力的不断涌现,引发了公众对评估和比较不同 LLM 的好奇心,这导致许多研究人员提出自己的 LLM 基准测试。我们注意到这些基准测试中存在初步的不足,于是我们开展了一项研究,通过我们新颖的统一评估框架从人、过程、技术三个维度,围绕基准测试的功能性和完整性进行批判性评估了 23 个最先进的 LLM 基准测试。我们的研究发现了显著的局限性,包括偏见、测量真正推理能力的困难、适应性评估不足、实施不一致、提示工程复杂性、评估者多样性不足以及对文化和意识形态规范的忽视等问题。我们的讨论强调了鉴于人工智能(AI)发展,迫切需要标准化的方法、监管确定性和伦理指南,包括倡导从静态基准测试向动态行为轮廓化的演变,以准确捕捉 LLM 的复杂行为和潜在风险。我们的研究突显了在 LLM 评估方法学方面需要范式转变的必要性,强调了为开发普遍被接受的基准测试以及增强 AI 系统在社会中的集成所需的合作努力的重要性。

关键词

引用

@article{arxiv.2402.09880,
  title  = {Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence},
  author = {Timothy R. McIntosh and Teo Susnjak and Nalin Arachchilage and Tong Liu and Paul Watters and Malka N. Halgamuge},
  journal= {arXiv preprint arXiv:2402.09880},
  year   = {2025}
}