依据轨迹修复与奖励:用于工具集成推理的工具使用轨迹
人工智能
2026-02-02 v1
摘要
工具集成推理(Tool-Integrated Reasoning, TIR)使大型语言模型(LLM)能够通过与外部工具交互来解决复杂任务,但现有方法依赖于由评分函数挑选的高质量合成轨迹以及稀疏的基于结果的奖励,为TIR学习提供有限且偏置的监督。为此,我们提出AutoTraj框架,通过修复和奖励工具使用轨迹来自动学习TIR。具体而言,在监督微调(SFT)阶段,AutoTraj为每个查询生成多个候选工具使用轨迹,并在多个维度上对其进行评估。高质量轨迹直接保留,而低质量轨迹则由LLM(即LLM作为修复者)进行修复。得到的修复后高质量轨迹构成合成SFT数据集,而每个修复后轨迹与其原始低质量版本的配对则构成轨迹偏好建模的数据集。在强化学习(RL)阶段,基于偏好数据集,我们训练轨迹级别的奖励模型来评估推理路径的质量,并将其与结果奖励和格式奖励结合,从而显式引导优化 toward可靠的TIR行为。在真实世界基准测试上的实验表明,AutoTraj在TIR方面的有效性。
引用
@article{arxiv.2601.23032,
title = {Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning},
author = {Siyu Gong and Linan Yue and Weibo Gao and Fangzhou Yao and Shimin Di and Lei Feng and Min-Ling Zhang},
journal= {arXiv preprint arXiv:2601.23032},
year = {2026}
}