ToolEyes:真实场景下大型语言模型工具学习能力的细粒度评估
计算与语言
2024-12-06 v3 人工智能
摘要
现有的工具学习评估主要侧重于验证大型语言模型(LLM)所选工具与预期结果的对齐。然而,这些方法依赖于答案可预先确定的有限场景,偏离了实际需求。此外,仅强调结果忽视了 LLM 有效使用工具所需的复杂能力。为解决此问题,我们提出 ToolEyes,一个专为评估 LLM 在真实场景中工具学习能力而量身定制的细粒度系统。该系统细致考察了七个真实场景,分析了 LLM 在工具学习中至关重要的五个维度:格式对齐、意图理解、行为规划、工具选择和答案组织。此外,ToolEyes 包含一个拥有约 600 个工具的工具库,作为 LLM 与物理世界之间的中介。涉及三个类别共十个 LLM 的评估揭示了其对特定场景的偏好以及工具学习中有限的认知能力。有趣的是,扩大模型规模甚至会加剧对工具学习的阻碍。代码和数据可在 https://github.com/Junjie-Ye/ToolEyes 获取。
引用
@article{arxiv.2401.00741,
title = {ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios},
author = {Junjie Ye and Guanyu Li and Songyang Gao and Caishuang Huang and Yilong Wu and Sixian Li and Xiaoran Fan and Shihan Dou and Tao Ji and Qi Zhang and Tao Gui and Xuanjing Huang},
journal= {arXiv preprint arXiv:2401.00741},
year = {2024}
}
备注
Accepted by COLING 2025 conference