FamilyTool:面向多跳个人化工具使用的基准
人工智能
2025-05-27 v2 计算与语言
摘要
将工具学习与大型语言模型 (Large Language Models, LLM) 的集成,已扩展了其处理复杂任务的能力,使其能够利用外部工具。然而,现有针对工具学习的基准测试不足以应对关键实际场景中的个人化情况,尤其是需要在动态环境中进行多跳推理和归纳知识适应的场景。为弥合这一差距,我们引入 FamilyTool,一个基于家庭知识图谱 (KG) 构建的新型基准,模拟个人化、多跳工具使用场景。FamilyTool 包括基础数据集和扩展数据集,挑战 LLM 处理的查询范围从 1 到 4 个关系跳 (例如,推断亲属关系和偏好) 到 2 到 6 个跳不等,并包含归纳 KG 设置,要求模型在无需重新训练的情况下适应未见过的用户偏好和关系,这是先前方法的一个常见局限,削弱了泛化能力。我们进一步提出 KGETool:一个简便的 KG 增强评估管道,用于系统性评估 LLM 在这些设置下的工具使用能力。实验结果显示,当前最先进的 LLM 在表现上存在显著差距,随着跳跃复杂度的增加,准确率会急剧下降,归纳场景则暴露出严重的泛化缺陷。这些发现凸显了当前 LLM 在处理个人化、动态真实环境方面的局限性,突显了在工具学习框架方面亟需进步的紧迫性。FamilyTool 作为评估和推动 LLM 代理在复杂动态环境中推理、可适应性和可扩展性的关键资源。代码和数据集可在 \href{https://github.com/yxzwang/FamilyTool}{https://github.com/yxzwang/FamilyTool} 获取。
引用
@article{arxiv.2504.06766,
title = {FamilyTool: A Multi-hop Personalized Tool Use Benchmark},
author = {Yuxin Wang and Yiran Guo and Yining Zheng and Zhangyue Yin and Shuo Chen and Jie Yang and Jiajun Chen and Yuan Li and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2504.06766},
year = {2025}
}