思维约束:一种面向语言模型引导搜索的约束推理框架
机器学习
2026-05-14 v3
摘要
尽管研究者在使大语言模型(LLMs)执行多步规划方面取得了显著进展,但 LLMs 仍难以确保这些规划与高层用户意图一致并满足符号约束,尤其是在复杂的多步领域中。链式思维(CoT)、思维树(ToT)以及验证器增强方法等现有推理方法扩展了搜索空间,但常常产生不可行的动作或幻觉步骤。为克服这些局限,我们提出思维约束(Const-o-T),一个提供结构化先验的框架,使蒙特卡洛树搜索(MCTS)能够聚焦于语义上有意义的路径。每一步推理被表示为(意图,约束)对,既用于压缩搜索空间,也用于强制可行性。与以往仅生成推理轨迹或事后验证输出的方法不同,Const-o-T 利用(意图,约束)对主动引导搜索朝向可行且有意义的规划。我们将 Const-o-T 集成到 MCTS 中,使用意图-约束对的结构化表示来剪枝不可行的分支,并引导探索朝向语义有效的动作,从而提升规划效率与可验证的决策。我们在 Risk 游戏、CAD 代码生成和算术推理三个领域上证明,我们的方法优于基线,取得了更高的准确性和更强的结构对齐性。我们的贡献在于证明 Const-of-T 为约束引导推理提供了可泛化的基础,使基于 LLM 的规划更加高效、符合约束且具备领域适应性。
引用
@article{arxiv.2510.08992,
title = {Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search},
author = {Kamel Alrashedy and Vriksha Srihari and Zulfiqar Zaidi and Ridam Srivastava and Pradyumna Tambwekar and Matthew Gombolay},
journal= {arXiv preprint arXiv:2510.08992},
year = {2026}
}