语言模型到底建模了什么?——Transformer、自动机与思维的格式
计算与语言
2025-08-27 v1 人工智能
摘要
大型语言模型到底建模了什么?它们向我们传递了关于人类能力的信息,还是仅仅是对训练语料库的模型呢?我将从非消解的角度支持后者。认知科学告诉我们,人类语言能力依赖于超线性的计算格式。而 Transformer 架构最多只能支持线性的处理格式。这一论证主要依赖于 Transformer 计算架构的某些不变量。随后,我将聚焦于 Liu 等人(2022)关于捷径自动机的有趣假设,构建一个关于 Transformer 实际运作方式的积极阐释。我指出,这一故事并不十分消解化。语言不仅是表达内在状态的工具,更是一种‘话语机器’,使我们能够在恰当的语境下生成新语言。我们已经学会以某种方式使用这一技术,而大语言模型也学会了使用,但方式则截然不同。
关键词
引用
@article{arxiv.2508.18598,
title = {What do language models model? Transformers, automata, and the format of thought},
author = {Colin Klein},
journal= {arXiv preprint arXiv:2508.18598},
year = {2025}
}