TL-Training:基于任务特征的用于训练大型语言模型工具使用的框架
计算与语言
2025-08-27 v2 人工智能
摘要
大型语言模型(LLM)通过利用工具与环境交互取得了显著进展,这是迈向通用人工智能的关键一步。然而,标准的监督微调(SFT)方法依赖于大规模数据集,往往忽略了工具使用中的任务特定特征,导致性能瓶颈。为了解决这个问题,我们分析了三个现有的 LLM 并揭示了关键见解:训练数据可能会无意中阻碍工具使用行为,token 重要性分布不均,且工具调用中的错误属于一小部分类别。基于这些发现,我们提出了 TL-Training,这是一个基于任务特征的框架,它减轻了次优训练数据的影响,在 SFT 期间动态调整 token 权重以优先处理关键 token,并引入了针对错误类别定制的稳健奖励机制,通过近端策略优化进行优化。我们通过训练 CodeLLaMA-2-7B 并在四个开源测试集上进行评估来验证 TL-Training。我们的结果表明,用我们方法训练的 LLM 仅使用 1,217 个训练数据点,在工具使用性能上就匹配或超越了开源和闭源 LLM。此外,我们的方法增强了在噪声环境中的鲁棒性并提高了通用任务性能,为 LLM 中的工具使用训练提供了一种可扩展且高效的范式。代码和数据可在 https://github.com/Junjie-Ye/TL-Training 获取。
引用
@article{arxiv.2412.15495,
title = {TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use},
author = {Junjie Ye and Yilong Wu and Sixian Li and Yuming Yang and Zhiheng Xi and Tao Gui and Qi Zhang and Xuanjing Huang and Peng Wang and Zhongchao Shi and Jianping Fan and Zhengyin Du},
journal= {arXiv preprint arXiv:2412.15495},
year = {2025}
}
备注
Accepted by EMNLP 2025