WTU-EVAL:面向大语言模型的是否使用工具评估基准
计算与语言
2024-07-19 v1 人工智能
摘要
尽管大语言模型(LLM)在 NLP 任务中表现出色,但它们仍需要外部工具来扩展其能力。当前关于 LLM 工具学习的研究通常假设强制性工具使用,这并不总是符合现实情况,在实际情况下,工具使用的必要性是不确定的,错误或不必要的工具使用会损害 LLM 的通用能力。因此,我们提出探索 LLM 是否能够 discern 其能力边界并灵活使用工具。随后,我们引入 Whether-or-not tool usage Evaluation benchmark(WTU-Eval),以 11 个数据集进行评估,其中 6 个为工具使用数据集,5 个为通用数据集。LLM 根据需要使用工具。八个 LLM 在 WTU-Eval 上的结果表明,LLM 在通用数据集中经常难以确定工具使用,而且在能力类似于 ChatGPT 时,LLM 在工具使用数据集中的表现会有所提升。在两个数据集中,错误的工具使用显著损害了 LLM 的表现。为缓解此问题,我们还开发了用于增强工具决策的微调数据集。对 Mistral-7B 进行微调后,平均性能提升 14%,错误工具使用的次数降低 16.8%。我们将发布 WTU-Eval 基准。
引用
@article{arxiv.2407.12823,
title = {WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models},
author = {Kangyun Ning and Yisong Su and Xueqiang Lv and Yuanzhe Zhang and Jian Liu and Kang Liu and Jinan Xu},
journal= {arXiv preprint arXiv:2407.12823},
year = {2024}
}