你的 LLM 真的掌握了概念吗?一个多智能体基准测试
人工智能
2026-02-12 v2 计算与语言
摘要
概念是支撑人类推理和分类的基本抽象。然而,目前尚不清楚大语言模型是否真正捕捉了此类概念结构,还是主要依赖表面级的模式记忆。现有基准测试大多是静态且面向事实的,这限制了它们探测细粒度语义理解的能力,并使其容易受到数据泄露和过拟合的影响。为解决这一局限,我们引入了 CK-Arena,一个基于多智能体社会推理游戏——即卧底游戏——的动态概念知识评估基准。在该设定中,基于 LLM 的智能体被分配细微不同的概念词汇,必须描述、区分并从他人的陈述中推断概念属性。模型性能通过游戏层级结果和生成描述的语义质量共同评估。此外,CK-Arena 利用交互过程自动构建高质量的问答数据,用于细粒度诊断分析。实验结果表明,概念理解在不同模型和类别间存在显著差异,并且与整体模型能力并不严格对齐。数据和代码可在项目主页获取:https://ck-arena.site。
引用
@article{arxiv.2505.17512,
title = {Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark},
author = {Shuhang Xu and Weijian Deng and Yixuan Zhou and Fangwei Zhong},
journal= {arXiv preprint arXiv:2505.17512},
year = {2026}
}
备注
8 pages