潜在思维优化:你的潜在推理语言模型在其潜在思维中秘密编码了奖励信号
计算与语言
2026-02-25 v3
摘要
大语言模型(LLM)通过生成自然语言思维链在解决问题方面表现出色,但这种言语化思维计算成本高昂且容易过度思考。近期一项工作提出了一种潜在思维架构 Huginn-3.5B,它将中间推理步骤表示为一系列潜在表征。然而,潜在思维缺乏可解释性且难以监督,引发了对其模型潜在思维过程正确性和可靠性的担忧。本文系统研究了 Huginn-3.5B 如何在潜在空间中思考,以及外部监督信号如何改进其潜在思维过程。我们表明,导致正确与错误答案的潜在思维表现出高度可区分的模式,并且一个潜在分类器可以直接从潜在思维中可靠地预测答案的正确性。利用这些见解,我们提出了潜在思维优化(Latent Thinking Optimization, LTO),这是一种概率算法,它采用潜在分类器作为潜在奖励模型(Latent Reward Model, LRM)来优化潜在思维过程。跨多种推理任务的广泛实验表明,LRM 在检测错误潜在思维模式方面非常有效,并且 LTO 可以显著改进潜在思维过程。此外,我们证明 LRM 可以跨不同领域泛化,并且 LTO 可以无缝应用于通用 LLM 以改进其思维过程。与言语化思维相比,我们的方法表明,奖励建模和通过监督扩展测试时思维可以直接在潜在空间中进行,突显了其作为一种通用、高效且领域无关的改进 LLM 思维过程方法的潜力。
引用
@article{arxiv.2509.26314,
title = {Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts},
author = {Hanwen Du and Yuxin Dong and Xia Ning},
journal= {arXiv preprint arXiv:2509.26314},
year = {2026}
}