中文

应用心智理论与大语言模型——ChatGPT 在解决社交情景中的表现如何

人机交互 2026-01-13 v1

摘要

语言人工智能 (AI) 的快速发展为心理治疗和助理系统提供了新的可能性,尤其受益于常对技术反应良好的自闭症个体。自闭症患者的父母强调重要的是合适且特定于情境的交流行为。本研究检验了 GPT-3.5 Turbo 和 GPT-4 作为基于语言的 AI 应用,是否在实际应用心智理论 (ToM) 的形式上复制这种恰当的交流行为。GPT-3.5 Turbo 和 GPT-4 被评估于三个既定的高阶 ToM 任务:错位测试 (Faux Pas Test)、社交故事问卷 (Social Stories Questionnaire) 和故事理解测试 (Story Comprehension Test),分别以英语和德语进行。两个独立的评分者根据标准化手册对响应准确性进行评分。此外,还对响应进行评分,以判定认知标记作为不确定性指示器。GPT 的结果被与人类典型和非典型样本(来自前人及他人研究)进行比较。GPT-4 在错位测试中接近人类水平,并超过 GPT-3.5 Turbo 和具有自闭症特征者。在社交故事问卷上,GPT-4 的得分相当于典型成年人,而 GPT-3.5 Turbo 仍低于。在故事理解测试中,GPT-4 的得分超过了典型成人和青少年的基准。然而,GPT-4 在最多 42% 的响应中使用认知标记。GPT-4 在复杂的高阶 ToM 任务中表现令人鼓舞,可能为具有(或不具有)社交沟通困难者提供未来的辅助工具。其解释复杂社交情境的能力令人期待;然而,频繁使用的不确定性标记凸显了在辅助使用方面的需要,以及可能需要进一步细化,以确保在实际使用中提供一致可靠的支持。

关键词

引用

@article{arxiv.2601.06032,
  title  = {Applied Theory of Mind and Large Language Models -- how good is ChatGPT at solving social vignettes?},
  author = {Anna Katharina Holl-Etten and Nina Schnaderbeck and Elizaveta Kosareva and Leonhard Aron Prattke and Ralph Krueger and Lisa Marie Warner and Nora C. Vetter},
  journal= {arXiv preprint arXiv:2601.06032},
  year   = {2026}
}

备注

40 pages, 6 figures, 3 supplements