中文

你的 LLM 真的掌握了概念吗?一个多智能体基准测试

人工智能 2026-02-12 v2 计算与语言

摘要

概念是支撑人类推理和分类的基本抽象。然而,目前尚不清楚大语言模型是否真正捕捉了此类概念结构,还是主要依赖表面级的模式记忆。现有基准测试大多是静态且面向事实的,这限制了它们探测细粒度语义理解的能力,并使其容易受到数据泄露和过拟合的影响。为解决这一局限,我们引入了 CK-Arena,一个基于多智能体社会推理游戏——即卧底游戏——的动态概念知识评估基准。在该设定中,基于 LLM 的智能体被分配细微不同的概念词汇,必须描述、区分并从他人的陈述中推断概念属性。模型性能通过游戏层级结果和生成描述的语义质量共同评估。此外,CK-Arena 利用交互过程自动构建高质量的问答数据,用于细粒度诊断分析。实验结果表明,概念理解在不同模型和类别间存在显著差异,并且与整体模型能力并不严格对齐。数据和代码可在项目主页获取:https://ck-arena.site。

关键词

引用

@article{arxiv.2505.17512,
  title  = {Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark},
  author = {Shuhang Xu and Weijian Deng and Yixuan Zhou and Fangwei Zhong},
  journal= {arXiv preprint arXiv:2505.17512},
  year   = {2026}
}

备注

8 pages