通过自演化偏好学习实现有效的工具集成推理
信息论
2025-09-30 v1 math.IT
摘要
工具集成推理(TIR)使大语言模型(LLMs)通过集成外部工具来提升其内部推理能力。然而,采用 TIR 的模型常常表现出次优行为,例如工具使用不足或过度,以及在调用工具后过度思考。如何激励 LLMs 高效且准确地执行 TIR,同时稳定推理过程,仍然是一个开放问题。在本文中,我们首先从信息熵的角度探索工具调用对模型推理的影响。我们的发现表明,工具调用结果会导致后续推理的信息熵发生显著变化,推理链的整体熵根据工具调用次数而变化。基于这些见解,我们提出了 Tool-Light,一个旨在鼓励 LLMs 高效且准确地执行 TIR 的框架。我们的框架包括数据集构建和多阶段微调。对于数据集构建,我们采用自演化连续采样,结合常规采样和熵引导采样。此外,我们在采样过程中建立了严格的正负样本对选择标准。训练过程采用两阶段方法,包括监督微调(SFT)和自演化直接偏好优化(DPO)。在 10 个数据集上的实验结果证明了 Tool-Light 的有效性,显著提升了模型执行 TIR 任务的效率。
引用
@article{arxiv.2509.23284,
title = {RIS-Assisted XL-MIMO for Near-Field and Far-Field Communications},
author = {Xiaomin Cao and Mohammadali Mohammadi and Hien Quoc Ngo and Hyundong Shin and Michail Matthaiou},
journal= {arXiv preprint arXiv:2509.23284},
year = {2025}
}
备注
The manuscript has been accepted for publication in IEEE TWC