中文

用语言模型理解语言模型的社会推理能力

计算与语言 2023-12-06 v2 人工智能 人机交互

摘要

随着大语言模型(LLMs)日益融入我们的日常生活,理解它们理解人类心理状态的能力对于确保有效交互变得至关重要。然而,尽管近期已有尝试评估 LLMs 的心理理论(ToM)推理能力,这些模型能在多大程度上与人类 ToM 对齐仍是一个需要细致探索的话题。这主要源于两个截然不同的挑战:(1)先前评估结果存在不一致,以及(2)对现有评估方法有效性的担忧。为应对这些挑战,我们提出了一种利用 LLMs 通过填充因果模板来程序化生成评估的新框架。使用该框架,我们创建了一个面向 LLMs 的新的社会推理基准(BigToM),其包含 25 个控制项和 5000 个由模型编写的评估。我们发现人类参与者对我们基准质量的评分高于先前的众包评估,且与专家编写的评估相当。利用 BigToM,我们评估了多种 LLMs 的社会推理能力,并将模型表现与人类表现进行了比较。我们的结果表明,GPT4 具有反映人类推理模式的 ToM 能力,尽管可靠性较低,而其他 LLMs 则表现不佳。

关键词

引用

@article{arxiv.2306.15448,
  title  = {Understanding Social Reasoning in Language Models with Language Models},
  author = {Kanishk Gandhi and Jan-Philipp Fränken and Tobias Gerstenberg and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2306.15448},
  year   = {2023}
}