中文

大语言模型及其有限的心智理论:评估情境对话中的心理状态标注

计算与语言 2025-09-03 v1

摘要

如果大语言模型不仅能推断人类的心智状态,还能揭示团队对话中的每一个盲点,例如团队成员之间共同理解上的差异呢?我们提出了一种新颖的两步框架,利用大语言模型(LLMs)既作为团队对话的人工风格标注者来追踪团队的共享心智模型(SMMs),又作为个体心理状态之间的自动差异检测器。在第一步中,LLM 通过识别合作远程搜索任务(CReST)语料库中任务导向对话内的 SMM 元素来生成标注。然后,第二个 LLM 将这些 LLM 生成的标注与人工标注对照金标准标签进行比较,以检测和刻画差异。我们为此用例定义了一个 SMM 一致性评估框架,并将其应用于六个 CReST 对话,最终产出:(1)一个人工和 LLM 标注的数据集;(2)一个可复现的 SMM 一致性评估框架;以及(3)一项基于 LLM 的差异检测的实证评估。我们的结果表明,尽管 LLMs 在简单的自然语言标注任务上表现出明显的一致性,但在需要空间推理或韵律线索消歧的场景中,它们会系统性地出错。

关键词

引用

@article{arxiv.2509.02292,
  title  = {LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue},
  author = {Katharine Kowalyshyn and Matthias Scheutz},
  journal= {arXiv preprint arXiv:2509.02292},
  year   = {2025}
}