中文

推进工具增强型大型语言模型:整合推理树中错误的洞察

计算与语言 2025-03-24 v2 人工智能 机器学习

摘要

工具增强型大型语言模型(LLM)利用工具(通常以API的形式)来提高其在复杂任务上的推理能力。这使得它们能够作为智能体与现实世界进行交互。Qin等人[2023]最近提出的ToolLLaMA模型利用基于深度优先搜索的决策树(DFSDT)机制进行多步推理,涉及16000+16000+个真实世界的API,与传统的链式推理机制相比,有效提升了工具增强型LLM的性能。然而,他们的方法仅使用决策树(也称为推理树)中的成功路径进行监督微调(SFT),错过了从失败路径中学习的机会。受此启发,我们提出了一种基于偏好学习的推理轨迹优化框架来解决这一局限性。我们首先引入了一种新颖的方法,从树状专家轨迹中构建逐步偏好数据,该方法利用了决策树中先前被忽略的失败探索。在随后的训练阶段,我们首先使用成功的工具使用专家轨迹对LLM进行微调,然后应用直接偏好优化(DPO)结合偏好数据来更新LLM的策略,从而得到我们的ToolPrefer-LLaMA(TP-LLaMA)模型。这种方法不仅增强了对原始专家数据的利用,还拓宽了模型的学习空间。我们的实验表明,通过从推理树的错误中获取洞察,TP-LLaMA在几乎所有测试场景中均大幅优于基线,并且在面对未见过的API时表现出更好的泛化能力。同时,TP-LLaMA相比基线也展现出更优越的推理效率,使其更适合复杂的工具使用推理任务。

关键词

引用

@article{arxiv.2406.07115,
  title  = {Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees},
  author = {Sijia Chen and Yibo Wang and Yi-Feng Wu and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and Lijun Zhang},
  journal= {arXiv preprint arXiv:2406.07115},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024