中文

活体语言 vs. 模拟语言:规模 matters,但更大的语言模型仍不具备与人类相当的语言理解能力,因其语义参照难以穿透

计算与语言 2025-06-30 v3

摘要

理解语言的限制是大型语言模型 (LLM) 成为自然语言理论的前提。然而,LLM 在某些语言任务上的表现呈现出量化和质化的差异,但仍需确定这些差异是否可由模型规模所致。本文考察规模扩大在弥补人类与模型之间差异方面的关键作用,探讨规模增长是否弥补了这些差异。我们测试了来自不同模型家族的三个 LLM(Bard,参数为 1370 亿;ChatGPT-3.5,参数为 1750 亿;ChatGPT-4,参数为 1.5 万亿),在包含指代、中心嵌套、比较级和负向 polarity 任务的语法正确性判断任务中进行测试。收集了 N=1200 项判断,评估其准确率、稳定性以及重复呈现提示后准确率的提升情况。以最佳表现模型 ChatGPT-4 的结果为基准,与 n=80 名人类在相同刺激下的结果进行比较。我们发现,人类整体准确率低于 ChatGPT-4(分别为 76% 与 80%),但这仅因 ChatGPT-4 在唯一一个任务条件下(即在语法正确句子上)超越了人类。此外,ChatGPT-4 的答案波动性高于人类(分别为 12.5% 与 9.6% 的概率表现出摆动)。因此,尽管模型规模增大可能导致更好的表现,但 LLM 仍不像人类那样敏感于(不)语法性。仅凭规模扩大似乎不太可能修复此问题。我们通过比较体内 (in vivo) 与体外 (in silico) 的语言学习,识别出三个关键差异:(i) 证据类型;(ii) 缺乏的刺激 (poverty of the stimulus);以及 (iii) 由于语义幻觉导致的语言参照难以穿透。

关键词

引用

@article{arxiv.2404.14883,
  title  = {Language in Vivo vs. in Silico: Size Matters but Larger Language Models Still Do Not Comprehend Language on a Par with Humans Due to Impenetrable Semantic Reference},
  author = {Vittoria Dentella and Fritz Guenther and Evelina Leivada},
  journal= {arXiv preprint arXiv:2404.14883},
  year   = {2025}
}