中文

DOTS:通过最优推理轨迹搜索在 LLM 中动态推理

人工智能 2025-08-08 v2 计算与语言 机器学习

摘要

增强大型语言模型(LLM)在推理方面的能力近年来受到广泛关注。以往研究表明,各种提示策略在帮助 LLM 推理(称为"推理动作")方面效果显著,例如分步思考、在作答前反思、使用程序解决等及其组合。然而,这些方法常常对所有问题应用静态、预定义的推理动作,而不考虑每个问题的特定特征或任务解决 LLM 的能力。本文提出了 DOTS,一种使 LLM 能针对每个问题的特定特征和任务解决 LLM 的内在能力进行动态推理的最优推理轨迹搜索方法。我们的 approach 包括三个关键步骤:i) 定义可组成各种推理动作轨迹的原子推理动作模块;ii) 通过针对特定任务解决 LLM 的迭代探索和评估为每个训练问题搜索最优动作轨迹;iii) 使用收集的最优轨迹训练 LLM 为不可见问题的推理轨迹进行规划。具体而言,我们提出了两种学习范式,即通过微调外部 LLM 作为规划器来指导任务解决 LLM,或直接微调任务解决 LLM 以内化推理动作规划能力。我们在八个推理任务上的实验表明,我们的方法在静态推理技术和基础指令调优方法方面 consistently 均优于。进一步分析表明,我们的方法使 LLM 能够根据问题复杂度调整计算资源,为更难的问题分配更深入的思考和推理。

关键词

引用

@article{arxiv.2410.03864,
  title  = {DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search},
  author = {Murong Yue and Wenlin Yao and Haitao Mi and Dian Yu and Ziyu Yao and Dong Yu},
  journal= {arXiv preprint arXiv:2410.03864},
  year   = {2025}
}

备注

Accepted to ICLR 2025