中文

ToMBench:衡量大型语言模型心智理论的基准测试

计算与语言 2024-12-10 v2 人工智能

摘要

心智理论(ToM)是感知并赋予他人心理状态的认知能力。近期研究引发了关于大型语言模型(LLM)是否展现出类似ToM能力的争论。然而,现有的ToM评估面临范围受限、主观判断和意外污染等挑战,导致评估不足。为此,我们引入ToMBench,具有三个关键特征:包含8个任务和31项社会认知能力的系统化评估框架、支持自动化和无偏评估的多选问答格式,以及严格避免数据泄露的从零构建的双语词汇表。基于ToMBench,我们对10个流行的LLM在不同任务和能力上的ToM性能进行了广泛实验。我们发现,即便是最先进的LLM如GPT-4也在人类水平上低于10个百分点,表明LLM尚未实现人类水平的心智理论。我们希望通过ToMBench,高效且有效地评估LLM的心智理论能力,从而促进具有内在社交智能的LLM的发展。

关键词

引用

@article{arxiv.2402.15052,
  title  = {ToMBench: Benchmarking Theory of Mind in Large Language Models},
  author = {Zhuang Chen and Jincenzi Wu and Jinfeng Zhou and Bosi Wen and Guanqun Bi and Gongyao Jiang and Yaru Cao and Mengting Hu and Yunghwei Lai and Zexuan Xiong and Minlie Huang},
  journal= {arXiv preprint arXiv:2402.15052},
  year   = {2024}
}

备注

ACL 2024