中文

大型语言模型与不可能语言习得:是“虚假承诺”还是对我们当前AI视角的颠覆

计算与语言 2026-05-19 v5

摘要

在乔姆斯基颇具挑衅性的评论《ChatGPT的虚假承诺》中,大型语言模型(LLM)被描述为仅仅是模式预测器,不像人类那样通过内在的因果和自我修正结构来习得语言,因此无法区分不可能语言。这是对AI智力基础的根本性挑战中的一个代表性观点,因为它综合了LLM方法论中的主要问题,并具有标志性的先验理性主义视角。我们从语言学和心理学的既有文献视角,以及基于一项探究LLM学习可能和不可能语言能力的实验研究,审视了这一著名评论。我们通过对英语应用某些转换,构建了一组句法上不可能的语言。这些转换包括反转整个句子,以及根据单词计数的奇偶性添加否定。分别在GPT-2小型模型和长短期记忆(LSTM)模型上进行了两轮对照实验。对单次运行训练轨迹的描述性分析表明,与不可能语言条件相比,GPT-2小型模型在自然语言上表现出更低的最终损失、更快的收敛速度和更低的困惑度,其中反转条件显示出最大的偏离(损失比高达自然语言的2.25倍)。相比之下,LSTM模型在不同条件下表现出最小的差异。鉴于我们实验的单次运行性质(每个条件n=1),我们报告了描述性比较,并提醒无法进行正式的统计推断。基于理论分析和描述性实证发现,我们在乔姆斯基理论框架内提出了关于LLM的新愿景,并在乔姆斯基理论之外提出了理论范式的转变,即从乔姆斯基的“理性主义-浪漫主义”范式转向LLM研究中的功能主义和经验主义。

关键词

引用

@article{arxiv.2602.08437,
  title  = {Large Language Models and Impossible Language Acquisition: "False Promise" or an Overturn of our Current Perspective towards AI},
  author = {Ziyan Wang and Longlong Ma},
  journal= {arXiv preprint arXiv:2602.08437},
  year   = {2026}
}