中文

即时思考:基于潜在思想策略优化的测试时推理增强

计算与语言 2026-01-27 v4 人工智能

摘要

最近的大型语言模型(LLM)进展正从显式的链式思考(Chain-of-Thought, CoT)推理转向更高效的潜在推理,其中中间思考被表示为向量而非文本。然而,潜在推理在面对具有挑战性的、分布外的任务时会显得脆弱,而此时对稳健推理最为关键。为克服这些限制,我们引入潜在思想策略优化(Latent Thought Policy Optimization, LTPO),这是一个无需模型参数更新的框架,可在测试时完全增强LLM的推理能力。LTPO将中间潜在“思考”向量视为针对每个问题实例都在主动优化的动态参数。它采用基于内在、基于置信度的奖励信号的在线策略梯度方法,该奖励信号直接计算于冻结的LLM自身的输出分布中,无需外部监督或在优化期间进行昂贵的文本生成。广泛的实验表明,LTPO不仅在标准任务上与或超越强大基线,而且在其他基线失败的地方展现出显著的鲁棒性。最突出的是,在高度具有挑战性的AIME基准测试上,现有的潜在推理基线会退化至接近零的准确率,而LTPO可实现显著的改进,展示了一种处理复杂推理的独特能力。

关键词

引用

@article{arxiv.2510.04182,
  title  = {Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization},
  author = {Wengao Ye and Yan Liang and Lianlei Shan},
  journal= {arXiv preprint arXiv:2510.04182},
  year   = {2026}
}

备注

Accepted to ICLR 2026