中文

大语言模型的能力能否用人类能力来描述?一项元研究

计算与语言 2025-04-18 v1 计算机与社会

摘要

大语言模型(LLM)的用户通常将这些模型视为具备类人能力的智能实体。然而,LLM 的能力在多大程度上真正接近人类能力仍是一个有争议的话题。在本文中,为了表征 LLM 能力与人类能力之间的关系,我们收集了 37 个评估基准上 80 多个模型的性能数据。这些评估基准在人类方面被划分为 6 种主要能力和 11 种子能力。然后,我们将性能排名聚类为若干类别,并将这些聚类结果与基于人类能力方面的分类进行了比较。我们的发现得出以下结论:1. 我们证实了参数量少于 100 亿的 LLM 的某些能力确实可以用人类能力指标来描述;2. 尽管某些能力在人类中被认为是相互关联的,但在 LLM 中它们却几乎不相关;3. LLM 所具备的能力随模型的参数规模发生显著变化。

关键词

引用

@article{arxiv.2504.12332,
  title  = {Can the capability of Large Language Models be described by human ability? A Meta Study},
  author = {Mingrui Zan and Yunquan Zhang and Boyang Zhang and Fangming Liu and Daning Cheng},
  journal= {arXiv preprint arXiv:2504.12332},
  year   = {2025}
}