将语言建模为思维序列
计算与语言
2026-01-14 v2 人工智能
摘要
变换器语言模型能够通过将语言建模为标记序列生成引人入目自然的文本,但由于主要依赖表面级共现统计,难以形成实体和事件的全局一致潜在表征,这导致差异泛化差(如颠倒诅咒)、上下文化错误和数据效率低下。认知科学则表明,人类理解将语言输入转换为持久存在于记忆中但文字形式短暂的紧凑、事件样 representations。鼓励这种发现,我们引入 Thought Gestalt(TG)模型,一种循环变换器,在两种抽象层次上建模语言:标记和句子级“思维”状态。TG 按句子生成文本,同时跨注意力于先前句子表征的工作记忆。标记和句子表征使用共享的变换器块生成并以单一目标——下一个标记预测损失训练。在保留句子表征写入工作记忆的计算图的情况下,来自未来标记损失的梯度可通过跨注意力反向传播以优化生成早期句子向量的参数。在规模实验中,TG 在数据和参数效率上 consistently 优于匹配的 GPT-2 和其他基线,规模拟合显示 GPT-2 需额外约 5-8% 数据和 33-42% 参数才能匹配 TG 的测试损失。TG 还减少了在父子颠倒诅咒探针上进行关系-方向泛化的错误。
引用
@article{arxiv.2512.25026,
title = {Modeling Language as a Sequence of Thoughts},
author = {Nasim Borazjanizadeh and James McClelland},
journal= {arXiv preprint arXiv:2512.25026},
year = {2026}
}