大语言模型与人类在基于脚本知识的因果推断中行为是否相似?
计算与语言
2023-11-14 v1 人工智能
摘要
近来,大预训练语言模型(LLMs)展现出优越的语言理解能力,包括零样本因果推理。然而,其能力在多大程度上与人类相似仍不清楚。我们在此研究脚本式故事中事件 的加工,该事件因果依赖于先前事件 。在我们的操控中,事件 在文本前段被陈述、否定或省略。我们首先进行了一项自定步速阅读实验,表明当存在因果冲突()时,人类的阅读时间显著长于逻辑条件()下。然而,当原因 A 未被明确提及时,阅读时间保持相似,表明人类可轻易从其脚本知识推断事件 B。我们随后在相同数据上测试了多种 LLM,以考察模型在多大程度上复现人类行为。实验表明:1) 仅近期 LLM(如 GPT-3 或 Vicuna)在 条件下与人类行为相关;2) 尽管存在此相关性,所有模型仍无法预测 不如 令人惊讶,表明 LLM 在整合脚本知识上仍有困难。我们的代码与收集的数据集见于 https://github.com/tony-hong/causal-script。
引用
@article{arxiv.2311.07311,
title = {Do large language models and humans have similar behaviors in causal inference with script knowledge?},
author = {Xudong Hong and Margarita Ryzhova and Daniel Adrian Biondi and Vera Demberg},
journal= {arXiv preprint arXiv:2311.07311},
year = {2023}
}
备注
15 pages, 3 figures