中文

PonderLM-2:基于连续空间中潜在思维的语言模型预训练

计算与语言 2026-03-10 v4

摘要

链式思维(Chain-of-Thought, CoT)的卓越成功通过在测试时扩展生成步骤来提升性能,启发我们思考:是否可以在预训练过程中通过类似的计算步骤扩展来改善每个单个 token 的生成?为此,我们提出了一种新颖的预训练方法:使用潜在思维(PonderLM-2)进行语言模型预训练。我们的方法预训练一个语言模型(LM),首先生成一个中间潜在思维——即当前位置的最后一个隐藏状态——然后将其用作预测实际后续 token 的输入。这种额外的计算步骤使 LM 能够在无约束的连续空间中细化其预测。我们的实验表明,在相同的推理成本下,生成每个 token 一个额外潜在思维的 LM 在性能上优于参数数额翻倍的标准模型。例如,我们的 PonderLM-2-Pythia-1.4B 在 Pile 上预训练了 3000 亿 token,显著优于在相同数据上进行相同训练的 vanilla Pythia-2.8B,表现出色,涵盖语言建模和各类通用下游任务。此外,增加每个实际 token 前生成的潜在思维数量——形成类似 CoT 的链式结构——可持续地提升模型性能。代码已公开于 https://github.com/LUMIA-Group/PonderLM-2。

关键词

引用

@article{arxiv.2509.23184,
  title  = {PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space},
  author = {Boyi Zeng and He Li and Shixiang Song and Yixuan Wang and Zitong Wang and Ziwei He and Xinbing Wang and Zhouhan Lin},
  journal= {arXiv preprint arXiv:2509.23184},
  year   = {2026}
}