中文

人类与大语言模型常识知识的大规模评估

人工智能 2026-01-23 v3 人机交互 社会与信息网络

摘要

常识知识是人工智能 (AI) 的重要组成部分,通常通过人类制定的ground-truth标签进行评估。这些标签隐含的重要假设是,它们准确地捕捉了任何人类会思考的内容,实际上将人类常识视为均匀的。然而,近期的实证研究表明,人类在何为常识方面存在巨大差异;因此,看似理所当然的看法对不同的评估设计者而言可能并非如此。本文提出一种评估 AI 中常识知识的方法,特别是针对大语言模型 (LLMs),通过测量模型判断与人类群体判断之间的对应关系来纳入对人类之间异质性的实证观察。首先,我们发现,当作为独立的调查受访者时,大多数 LLMs 在 individual 常识能力方面仍低于人类中位数。其次,当用作模拟假设群体时,LLMs 与真实人类的关联仅在程度上有所提升,即它们在对同一组陈述的接受程度方面的一致性。无论如何,较小的、开源的模型在竞争力上 surprisingly 超过较大的、专有版压倒性模型。将常识知识与其文化基础联系起来的本评估框架,为适应拥有不同且可能不相容社会知识储备的群体所提出的呼声做出了贡献。

关键词

引用

@article{arxiv.2505.10309,
  title  = {A large-scale evaluation of commonsense knowledge in humans and large language models},
  author = {Tuan Dung Nguyen and Duncan J. Watts and Mark E. Whiting},
  journal= {arXiv preprint arXiv:2505.10309},
  year   = {2026}
}

备注

Code and data: https://github.com/Watts-Lab/commonsense-llm-eval