中文

语言模型到底建模了什么?——Transformer、自动机与思维的格式

计算与语言 2025-08-27 v1 人工智能

摘要

大型语言模型到底建模了什么?它们向我们传递了关于人类能力的信息,还是仅仅是对训练语料库的模型呢?我将从非消解的角度支持后者。认知科学告诉我们,人类语言能力依赖于超线性的计算格式。而 Transformer 架构最多只能支持线性的处理格式。这一论证主要依赖于 Transformer 计算架构的某些不变量。随后,我将聚焦于 Liu 等人(2022)关于捷径自动机的有趣假设,构建一个关于 Transformer 实际运作方式的积极阐释。我指出,这一故事并不十分消解化。语言不仅是表达内在状态的工具,更是一种‘话语机器’,使我们能够在恰当的语境下生成新语言。我们已经学会以某种方式使用这一技术,而大语言模型也学会了使用,但方式则截然不同。

关键词

引用

@article{arxiv.2508.18598,
  title  = {What do language models model? Transformers, automata, and the format of thought},
  author = {Colin Klein},
  journal= {arXiv preprint arXiv:2508.18598},
  year   = {2025}
}