中文

通过循环语言模型扩展潜在推理

计算与语言 2025-11-19 v4

摘要

现代大语言模型(LLM)主要通过显式文本生成来"思考",例如链式思维(CoT),将推理延迟到微调阶段,充分利用前训练数据方面存在不足。我们提出并开源Ouro,作为递归的Ouroboros(蛇咬自身),一族预训练的循环语言模型(LoopLM),其通过(i)在潜在空间中的迭代计算、(ii)用于学习深度分配的熵正则化目标以及(iii)扩展至7.7T标记实现,将推理内置于前训练阶段。Ouro 1.4B和2.6B模型的性能优越,可匹配最高达12B参数的SOTA LLM在广泛基准测试中的结果。通过控制实验,我们表明这种优势源自知识容量增加,而非知识操作能力的提升。我们还表明LoopLM产生的推理痕迹更符合最终输出。我们希望我们的结果表明LoopLM作为推理时代的新型扩展方向具有潜力。我们的模型可在此处访问:http://ouro-llm.github.io。

关键词

引用

@article{arxiv.2510.25741,
  title  = {Scaling Latent Reasoning via Looped Language Models},
  author = {Rui-Jie Zhu and Zixuan Wang and Kai Hua and Tianyu Zhang and Ziniu Li and Haoran Que and Boyi Wei and Zixin Wen and Fan Yin and He Xing and Lu Li and Jiajun Shi and Kaijing Ma and Shanda Li and Taylor Kergan and Andrew Smith and Xingwei Qu and Mude Hui and Bohong Wu and Qiyang Min and Hongzhi Huang and Xun Zhou and Wei Ye and Jiaheng Liu and Jian Yang and Yunfeng Shi and Chenghua Lin and Enduo Zhao and Tianle Cai and Ge Zhang and Wenhao Huang and Yoshua Bengio and Jason Eshraghian},
  journal= {arXiv preprint arXiv:2510.25741},
  year   = {2025}
}