中文

通过展开树发现和强化工具集成推理链

计算与语言 2026-01-19 v2

摘要

工具集成推理已成为增强大语言模型(LLM)计算能力的关键范式,然而将工具使用融入长思维链(long CoT)仍是一个未被充分探索的领域,这主要是由于训练数据的稀缺以及在不损害模型内在长链推理能力的情况下集成工具使用的挑战。在本文中,我们介绍了DART(通过展开树发现和强化工具集成推理链),这是一个无需人工标注即可在长CoT推理过程中实现自发工具使用的强化学习框架。DART通过在训练期间构建动态展开树来发现有效的工具使用机会,在有前景的位置进行分支以探索多样化的工具集成轨迹。随后,基于树的进程优势估计识别并奖励那些工具调用对解决方案有积极贡献的特定子轨迹,从而有效强化这些有益行为。在AIME和GPQA-Diamond等具有挑战性的基准上的大量实验表明,DART显著优于现有方法,成功地将工具执行与长CoT推理协调起来。

关键词

引用

@article{arxiv.2601.08274,
  title  = {Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees},
  author = {Kun Li and Zenan Xu and Junan Li and Zengrui Jin and Jinghao Deng and Zexuan Qiu and Bo Zhou},
  journal= {arXiv preprint arXiv:2601.08274},
  year   = {2026}
}