中文

MatchTIR:基于二分匹配的工具集成推理细粒度监督

计算与语言 2026-01-16 v1 人工智能

摘要

工具集成推理(Tool-Integrated Reasoning, TIR)通过将推理步骤与外部工具交互交替进行,使大语言模型(LLM)能够处理复杂任务。然而,现有的强化学习方法通常依赖于结果级或轨迹级的奖励,为轨迹内的所有步骤分配统一的广义优势。这种粗粒度的信用分配无法区分有效的工具调用与冗余或错误的调用,在长周期多轮场景中尤为明显。为了解决这一问题,我们提出了 MatchTIR,这是一个通过基于二分匹配的轮级奖励分配和双层优势估计引入细粒度监督的框架。具体而言,我们将信用分配表述为预测轨迹与真实轨迹之间的二分匹配问题,利用两种分配策略推导出密集的轮级奖励。此外,为了平衡局部步骤精度与全局任务成功率,我们引入了一种双层优势估计方案,该方案整合了轮级和轨迹级信号,为各个交互轮次分配不同的优势值。在三个基准上的广泛实验证明了 MatchTIR 的优越性。值得注意的是,我们的 4B 模型超越了大多数 8B 竞争对手,特别是在长周期和多轮任务中。我们的代码可在 https://github.com/quchangle1/MatchTIR 获取。

关键词

引用

@article{arxiv.2601.10712,
  title  = {MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching},
  author = {Changle Qu and Sunhao Dai and Hengyi Cai and Jun Xu and Shuaiqiang Wang and Dawei Yin},
  journal= {arXiv preprint arXiv:2601.10712},
  year   = {2026}
}