中文

推进与基准测试大语言模型的个性化工具调用

计算与语言 2025-05-08 v1 人工智能

摘要

工具调用是扩展大语言模型(LLMs)能力的关键机制,近期受到了广泛关注。它使LLMs能够通过工具调用来解决复杂问题,同时获取最新的世界知识。然而,现有工作主要关注LLMs调用工具解决问题的基本能力,而未考虑工具调用中的个性化约束。在这项工作中,我们引入了“个性化工具调用”的概念,并定义了两个关键任务:工具偏好和基于画像的查询。工具偏好处理在功能相似的工具中进行选择时的用户偏好,而基于画像的查询则考虑用户查询缺少某些工具参数的情况,要求模型从用户画像中推断这些参数。为了应对这些挑战,我们提出了PTool,一个专为个性化工具调用设计的数据合成框架。此外,我们构建了PTBench,这是首个用于评估个性化工具调用的基准。随后,我们对各种开源模型进行了微调,证明了我们框架的有效性,并提供了有价值的见解。我们的基准测试已在https://github.com/hyfshadow/PTBench上公开。

关键词

引用

@article{arxiv.2505.04072,
  title  = {Advancing and Benchmarking Personalized Tool Invocation for LLMs},
  author = {Xu Huang and Yuefeng Huang and Weiwen Liu and Xingshan Zeng and Yasheng Wang and Ruiming Tang and Hong Xie and Defu Lian},
  journal= {arXiv preprint arXiv:2505.04072},
  year   = {2025}
}

备注

14 pages, 7 figures, 5 tables