在 GPT-3 与 GPT-4 中检验词意义的因果模型
计算与语言
2023-05-25 v1
摘要
大语言模型(LLMs)推动了 NLP 的非凡进步。然而,此类模型如何表征词汇概念——即它们所用词的含义——仍不清楚。本文通过 HIPE 理论的视角评估 GPT-3 和 GPT-4 的词汇表征,该理论是一种聚焦于描述人工制品(如“拖把”、“铅笔”和“哨子”)词语表征的概念表征理论。该理论假设了一个因果图,将此类词的含义与其所指对象的形式、用途和历史相关联。我们使用 Chaigneau 等人(2004)最初用于在人类中评估该理论的相同刺激来测试 LLMs,并考虑了多种提示设计。我们的实验涉及对因果结果、对象功能和对象命名的判断。我们发现没有证据表明 GPT-3 编码了 HIPE 假设的因果结构,但确实发现证据表明 GPT-4 编码了此类结构。这些结果有助于日益增多的刻画大语言模型表征能力的研究。
引用
@article{arxiv.2305.14630,
title = {Testing Causal Models of Word Meaning in GPT-3 and -4},
author = {Sam Musker and Ellie Pavlick},
journal= {arXiv preprint arXiv:2305.14630},
year = {2023}
}
备注
Unabridged version. Code available at https://github.com/smusker/Causal_Models_Of_Word_Meaning