CostBench:评估 LLM 工具使用智能体在动态环境中多轮成本最优规划与适应能力
人工智能
2026-04-06 v2 计算与语言
摘要
当前对大型语言模型 (LLM) 智能体的评估主要强调任务完成度,往往忽视资源效率和适应性。这忽略了一种关键能力:智能体如何应对变化的环境制定并调整成本最优计划。为弥合这一差距,我们引入 CostBench,一个可扩展且以成本为中心的基准,用于评估智能体的经济推理和重规划能力。CostBench 建立在旅行规划领域,包含可通过多种原子与复合工具序列来解决的任务,这些工具具有多样且可自定义的成本。它还支持四种动态阻塞事件类型,如工具故障和成本变化,以模拟现实世界的不可预测性,迫使智能体实时适应。对 CostBench 上领先的开源和专有模型进行评估,揭示了成本意识规划的显著差距:智能体经常无法在静态设置中识别成本最优解,GPT-5 在最难的任务上也仅达到约 75% 的精确匹配率,在动态条件下性能进一步下降约 40%。通过诊断这些弱点,CostBench 为开发具备经济理性和鲁棒性的智能体奠定了基础。
引用
@article{arxiv.2511.02734,
title = {CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents},
author = {Jiayu Liu and Cheng Qian and Zhaochen Su and Qing Zong and Shijue Huang and Bingxiang He and Yi R. Fung},
journal= {arXiv preprint arXiv:2511.02734},
year = {2026}
}