CogToM:受人类认知启发的大语言模型心智理论综合基准
人工智能
2026-01-23 v1
摘要
大语言模型是否真正具备类人的心智理论能力已受到越来越多的关注。然而,现有的基准测试很大程度上局限于错误信念任务等狭窄范式,未能涵盖人类认知机制的全部范畴。我们引入了 CogToM,这是一个全面且具有理论基础的基准测试,包含跨越 46 种范式的 8000 多个双语实例,并由 49 名人工标注者验证。对包括 GPT-5.1 和 Qwen3-Max 等前沿模型在内的 22 个代表性模型的系统评估揭示了显著的性能异质性,并突出了特定维度上持续存在的瓶颈。基于人类认知模式的进一步分析表明,LLM 与人类认知结构之间存在潜在的差异。CogToM 为研究 LLM 不断演变的认知边界提供了一个稳健的工具和视角。
引用
@article{arxiv.2601.15628,
title = {CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models},
author = {Haibo Tong and Zeyang Yue and Feifei Zhao and Erliang Lin and Lu Jia and Ruolin Chen and Yinqian Sun and Qian Zhang and Yi Zeng},
journal= {arXiv preprint arXiv:2601.15628},
year = {2026}
}