ToLeaP:重新思考大语言模型工具学习的开发
人工智能
2025-05-20 v1
摘要
工具学习使大语言模型 (LLM) 能够有效利用外部工具,已引起日益关注,因其潜力在多个行业中革新生产力。尽管工具学习取得了快速发展,但关键挑战和机遇仍未得到充分研究,限制了深入见解和未来进展。在本文中,我们通过复现 33 个基准并为其中七个实现一键评估,调查了 41 个主流 LLM 的工具学习能力,形成一个名为 ToLeaP 的工具学习平台。我们还收集了 21 个 33 个潜在训练数据集,以促进未来探索。在基于 ToLeaP 分析了 41 个 LLM 的 3,000 多个坏案后,我们识别出四个主要关键挑战:(1) 基准局限性导致既忽视又缺乏 (2) 自主学习,(3) 泛化,以及 (4) 长期任务解决能力。为促进未来发展,我们进一步探索了潜在方向,包括 (1) 现实世界基准构建,(2) 兼容性感知的自主学习,(3) 通过思考进行理由学习,以及 (4) 识别和记忆关键线索。初步实验表明这些方法的有效性,凸显了需要进一步研究和探索的需求。
引用
@article{arxiv.2505.11833,
title = {ToLeaP: Rethinking Development of Tool Learning with Large Language Models},
author = {Haotian Chen and Zijun Song and Boye Niu and Ke Zhang and Litu Ou and Yaxi Lu and Zhong Zhang and Xin Cong and Yankai Lin and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2505.11833},
year = {2025}
}