ToolSpectrum:面向大语言模型的个性化工具利用基准
计算与语言
2025-05-23 v2 人工智能
摘要
虽然将外部工具集成到大语言模型(LLM)中可以增强其访问实时信息和特定领域服务的能力,但现有方法仅关注基于用户指令的功能性工具选择,忽略了工具选择中的情境感知个性化。这种 oversight 导致用户满意度不佳和工具利用效率低下,尤其是在工具集合重叠且需要基于情境因素进行细致选择时。为弥合这一差距,我们引入ToolSpectrum,一个旨在评估LLM在个性化工具利用方面能力的基准测试。具体而言,我们正式化了两个关键的个性化维度:用户画像和环境因素,并分析它们的单独和综合影响对工具利用的影响。通过对ToolSpectrum上的大量实验,我们展示了个性化工具利用在 diverse 场景中显著提升了用户体验。然而,即便是最先进的LLM也表现出在联合推理用户画像和环境因素方面有限的能力,往往在一个维度上优先而忽视另一个维度。我们的发现凸显了工具增强型LLM中情境感知个性化的必要性,并揭示了当前模型的关键局限性。我们的数据和代码已公开于 https://github.com/Chengziha0/ToolSpectrum。
引用
@article{arxiv.2505.13176,
title = {ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models},
author = {Zihao Cheng and Hongru Wang and Zeming Liu and Yuhang Guo and Yuanfang Guo and Yunhong Wang and Haifeng Wang},
journal= {arXiv preprint arXiv:2505.13176},
year = {2025}
}
备注
Accepted by ACL 2025 Findings