CoMMET:LLM 在理论心智任务中能跌得几分?
计算与语言
2026-03-13 v1
摘要
理论心智 (ToM)——即对自身和他人心理状态进行推理的能力——是人类社会智能的基石。随着大型语言模型 (LLM) 在现实应用中变得无处不在,验证其进行此类社会推理的能力对于实现有效且自然的交互至关重要。然而,现有评估 LLM ToM 能力的基准受限;大多数基准仅依赖文本输入,且仅聚焦于信念相关任务。在本文中,我们提出了新的多模态基准数据集 CoMMET,即受 Theory of Mind Booklet Task 启发的综合性心理状态和道德评估任务。CoMMET 扩充了评估范围,涵盖更广泛的心理状态并引入多轮测试。据我们所知,这是首个用于评估 LLM 在多轮对话环境中 ToM 能力的多模态数据集。通过对不同家族和规模的 LLM 进行全面评估,我们分析了当前模型的优势与局限,并确定了未来改进的方向。我们的工作提供了对现代 LLM 社会认知能力的更深入理解。
引用
@article{arxiv.2603.11915,
title = {CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?},
author = {Ruirui Chen and Weifeng Jiang and Chengwei Qin and Cheston Tan},
journal= {arXiv preprint arXiv:2603.11915},
year = {2026}
}