测试时深度思考以探索隐式规则
人工智能
2026-05-26 v1
摘要
随着大型语言模型(LLMs)的不断进步,智能体正变得越来越重要。然而,这些智能体在由隐式规则支配的环境中常常失败——隐式规则是无法直接观察到的隐藏约束,必须通过交互来推断。这导致智能体陷入重复的试错循环,最终导致任务失败。为了应对这一挑战,我们提出了测试时探索(TTExplore)框架,其中思考者组件分析交互历史以推断这些隐式规则并指导行动者。在这种设置中,有效的探索关键取决于思考者的推理能力。然而,评估深度推理轨迹本质上是不稳定且困难的,这对有效训练构成了重大障碍。为了克服这个问题,我们引入了一种新颖且稳定的强化学习流水线。核心思想是使用准确的任务级分数作为间接奖励,以绕过评估中间推理的困难,并且每个轨迹只保留一个思考节点以缓解奖励稀疏性。使用此流水线,我们训练了一个专门的7B模型Exp-Thinker。在五个基于文本的具体任务上的实验表明,配备Exp-Thinker的TTExplore将基线智能体性能平均提高了-个百分点,证明了显式推理隐式规则的有效性。
引用
@article{arxiv.2605.24828,
title = {Test-Time Deep Thinking to Explore Implicit Rules},
author = {Wentong Chen and Xin Cong and Zhong Zhang and Yaxi Lu and Siyuan Zhao and Yesai Wu and Qinyu Luo and Haotian Chen and Yankai Lin and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2605.24828},
year = {2026}
}