广义语言:大语言模型、ChatGPT、奠基、意义与理解
计算与语言
2025-02-18 v2 神经元与认知
摘要
撇开 OpenAI 可能向我们隐瞒的(极少数)细节不谈,我们(大致)都知道 ChatGPT 是如何工作的(其庞大的文本数据库、统计学特征、向量表示及其海量参数、下一词训练等等)。但我们中没有人能(扪心自问地)说,我们对 ChatGPT 利用这些资源所能做到的事情不感到惊讶。这甚至促使我们中的一些人得出结论,认为 ChatGPT 实际上具有理解能力。说它具有理解能力是不对的。但说我们理解它是如何做到这些的,同样也不对。我将提出一些关于良性偏置的直觉看法:在 LLM 规模上涌现的收敛约束,可能正是帮助 ChatGPT 表现得远超我们预期的原因。这些偏置是语言本身在 LLM 规模上所固有的,并且它们与 ChatGPT 所缺失的东西密切相关,即将其词语与指代物、将其命题与意义联系起来的直接感觉运动奠基。这些收敛偏置涉及:(1) 间接言语奠基对直接感觉运动奠基的寄生性,(2) 言语定义的循环性,(3) 语言生成与理解的镜像关系,(4) LLM 规模下命题的象似性,(5) 神经网络类别学习中人类类别感知的计算对应物,以及可能还有 (6) 乔姆斯基关于思维定律的猜想。本文的阐述将以与 ChatGPT-4 对话的形式展开。
引用
@article{arxiv.2402.02243,
title = {Language Writ Large: LLMs, ChatGPT, Grounding, Meaning and Understanding},
author = {Stevan Harnad},
journal= {arXiv preprint arXiv:2402.02243},
year = {2025}
}
备注
54 pages, 29 references