基于自适应潜在链式思考的预训练
计算与语言
2026-03-11 v2
摘要
通过增加参数和训练数据来扩大大型语言模型的规模正日益受到高质量语料库有限和通信成本上升的制约。这项工作探索了另一条轴线:在不扩展参数的前提下,通过增加每个标记的计算量来实现这一点,内在化潜在链式思考(Chain-of-Thought, CoT)到预训练中。我们提出了基于标记级自适应潜在CoT的预训练方法(adaptive latent CoT),该方法在发射每个标记之前生成可变长度的潜在CoT轨迹——将较长的轨迹分配给困难的标记,将较短(甚至为零)的轨迹分配给容易的标记。重要的是,这种行为从在通用文本上的单阶段预训练中自然涌现,并且通过基于标记的自适应中止在训练和推理中减少计算。使用Llama架构进行的实验表明,自适应潜在CoT在语言建模困惑度和广泛的下游准确率方面一致性地取得改进,即使在训练FLOPs少于先前循环基线的情况下也如此。
引用
@article{arxiv.2602.08220,
title = {Pretraining with Token-Level Adaptive Latent Chain-of-Thought},
author = {Boyi Zeng and Yiqin Hao and He Li and Shixiang Song and Feichen Song and Zitong Wang and Siyuan Huang and Yi Xu and ZiWei He and Xinbing Wang and Zhouhan Lin},
journal= {arXiv preprint arXiv:2602.08220},
year = {2026}
}
备注
15pages