超越完美 API:野下LLM代理在现实 API 复杂性下的全面评估
计算与语言
2026-01-05 v1 人工智能
摘要
我们引入 WildAGTEval,这是一个旨在评估大型语言模型(LLM)代理在现实 API 复杂性下的函数调用能力的基准测试。与此前工作不同,后者假设 API 系统为理想化状态,忽略了诸如噪声 API 输出等现实因素。WildAGTEval 考虑了两维现实复杂性:1. API 规范,包括详细的文档和使用约束;2. API 执行,捕捉运行时挑战。因此,WildAGTEval 提供了(i)包含约 32K 种可组合的约 60 种复杂场景的 API 系统,以及(ii)用于评估 LLM 代理在这些场景上的用户-代理交互。使用 WildAGTEval,我们系统评估了几种先进的 LLM,发现大多数场景都具有挑战性,其中与无关信息复杂度最高,使强 LLM 的性能下降 27.3%。此外,我们的定性分析表明,LLM 有时会扭曲用户意图仅为声称完成任务,这严重影响用户满意度。
引用
@article{arxiv.2601.00268,
title = {Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity},
author = {Doyoung Kim and Zhiwei Ren and Jie Hao and Zhongkai Sun and Lichao Wang and Xiyao Ma and Zack Ye and Xu Han and Jun Yin and Heng Ji and Wei Shen and Xing Fan and Benjamin Yao and Chenlei Guo},
journal= {arXiv preprint arXiv:2601.00268},
year = {2026}
}
备注
26 pages