AgentBoard:多轮LLM智能体的分析评估看板
计算与语言
2024-12-25 v2 人工智能
机器学习
摘要
将大型语言模型(Large Language Models, LLMs)作为通用智能体进行评估,对于理解其能力并促进其融入实际应用至关重要。然而,评估过程面临着重大的挑战。主要障碍是在统一框架内对跨不同场景的智能体性能进行基准测试,特别是在维持部分可观测环境和确保多轮交互方面。此外,当前的评估框架大多关注最终成功率,在过程中揭示的见解很少,无法提供对模型能力的深入理解。为了应对这些挑战,我们引入了AgentBoard,这是一个开创性的综合基准测试及配套的开源评估框架,专为LLM智能体的分析评估而定制。AgentBoard提供了一种细粒度的进度率指标,能够捕捉增量进展,同时提供了一个综合评估工具包,其特点是对智能体进行易于评估的多方面分析。这不仅阐明了LLM智能体的能力和局限性,而且将其性能的可解释性推向了前沿。最终,AgentBoard作为揭开智能体行为神秘面纱并加速更强大LLM智能体开发的一步。
引用
@article{arxiv.2401.13178,
title = {AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents},
author = {Chang Ma and Junlei Zhang and Zhihao Zhu and Cheng Yang and Yujiu Yang and Yaohui Jin and Zhenzhong Lan and Lingpeng Kong and Junxian He},
journal= {arXiv preprint arXiv:2401.13178},
year = {2024}
}
备注
NeurIPS 2024 (Oral)