真实场景下LLM工具使用的基准测试
人机交互
2026-04-09 v1 人工智能
计算与语言
摘要
通过大型语言模型的多轮、多步工具使用来满足用户需求很少是一个直接的过程。真实的用户交互本质上是野性的、复杂的、混乱的和灵活的。我们从用户行为中识别出三个关键挑战:需要高效编排工具调用拓扑的组合式任务,分布在对话轮次中需要上下文推理的隐式意图,以及指令转换,它混合了任务查询、澄清和随意对话,迫使LLM随时调整其策略。现有的基准测试忽视了这些行为,使得LLM在工具使用方面的表面进展具有虚假性。为了解决这一问题,我们引入了WildToolBench,一个基于真实世界用户行为模式的LLM工具使用基准。对57个LLM的全面评估显示,没有一个模型的准确率超过15%,表明LLM智能体能力的鲁棒性存在重大差距。受控实验和深入分析进一步表明,LLM工具使用的真正挑战不在于人为复杂的任务,而在于用户行为的野性本质,强调了需要重新考虑LLM、用户和工具之间的交互。
引用
@article{arxiv.2604.06185,
title = {Benchmarking LLM Tool-Use in the Wild},
author = {Peijie Yu and Wei Liu and Yifan Yang and Jinjian Li and Zelong Zhang and Xiao Feng and Feng Zhang},
journal= {arXiv preprint arXiv:2604.06185},
year = {2026}
}
备注
accepted by ICLR 2026