OpenToM:评估大语言模型心智理论推理能力的综合基准
人工智能
2024-06-04 v3 计算与语言
摘要
神经心智理论(N-ToM)——机器理解并追踪他人心理状态的能力——对于开发具有社会智能的智能体至关重要。然而,现有的N-ToM基准存在若干缺陷,包括叙事模糊且人为痕迹重、缺乏个性特征和偏好、缺少针对角色心理状态的问题,以及所提问题多样性有限。针对这些问题,我们构建了OpenToM,一个新的N-ToM评估基准,其特点包括:(1) 更长且更清晰的叙事故事,(2) 具有明确个性特征的角色,(3) 由角色意图触发的行动,以及(4) 旨在挑战大语言模型(LLM)对角色在物理世界和心理世界中心理状态建模能力的问题。利用OpenToM,我们发现最先进的LLM在建模物理世界中心理状态的某些方面表现出色,但在追踪角色心理世界中的心理状态时则有所不足。
引用
@article{arxiv.2402.06044,
title = {OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models},
author = {Hainiu Xu and Runcong Zhao and Lixing Zhu and Jinhua Du and Yulan He},
journal= {arXiv preprint arXiv:2402.06044},
year = {2024}
}
备注
ACL 2024