中文

Thoughts-as-Planning:基于强化规划的链式思维优化的潜在世界模型

计算与语言 2026-05-29 v1 人工智能

摘要

大型语言模型(LLM)在 diverse NLP 任务上的成功提升了推理链优化的重要性,这已成为将模型行为与任务目标对齐的关键步骤。现有的推理链调优方法常依赖黑箱启发式或梯度-free 搜索,缺乏可解释性、泛化能力和样本效率。在本工作中,我们引入了 Thoughts-as-Planning,一种将推理链优化形式化为潜在语义空间上顺序决策过程的新框架。我们将 LLM 模型化为部分可观测环境,并学习潜在世界模型以模拟推理链编辑对下游输出的影响。构建一个保留接近性的嵌入空间,对推理链-响应动力学进行编码,从而实现通过梯度下降或强化学习进行规划。该方法支持多尺度抽象,允许在 token、segment 和 instruction 级别集成推理链编辑。通过在语言理解和生成任务上的大量实验,我们展示了 Thoughts-as-Planning 在效率、鲁棒性和泛化性方面均优于最先进的推理链调优基准,同时通过其结构化规划轨迹提供可解释性。我们的代码可在 https://github.com/FastLM/Thoughts-as-Planning 查阅。

关键词

引用

@article{arxiv.2605.28842,
  title  = {Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning},
  author = {Dong Liu and Yanxuan Yu and Ying Nian Wu},
  journal= {arXiv preprint arXiv:2605.28842},
  year   = {2026}
}