中文

AgentBoard:多轮LLM智能体的分析评估看板

计算与语言 2024-12-25 v2 人工智能 机器学习

摘要

将大型语言模型(Large Language Models, LLMs)作为通用智能体进行评估,对于理解其能力并促进其融入实际应用至关重要。然而,评估过程面临着重大的挑战。主要障碍是在统一框架内对跨不同场景的智能体性能进行基准测试,特别是在维持部分可观测环境和确保多轮交互方面。此外,当前的评估框架大多关注最终成功率,在过程中揭示的见解很少,无法提供对模型能力的深入理解。为了应对这些挑战,我们引入了AgentBoard,这是一个开创性的综合基准测试及配套的开源评估框架,专为LLM智能体的分析评估而定制。AgentBoard提供了一种细粒度的进度率指标,能够捕捉增量进展,同时提供了一个综合评估工具包,其特点是对智能体进行易于评估的多方面分析。这不仅阐明了LLM智能体的能力和局限性,而且将其性能的可解释性推向了前沿。最终,AgentBoard作为揭开智能体行为神秘面纱并加速更强大LLM智能体开发的一步。

关键词

引用

@article{arxiv.2401.13178,
  title  = {AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents},
  author = {Chang Ma and Junlei Zhang and Zhihao Zhu and Cheng Yang and Yujiu Yang and Yaohui Jin and Zhenzhong Lan and Lingpeng Kong and Junxian He},
  journal= {arXiv preprint arXiv:2401.13178},
  year   = {2024}
}

备注

NeurIPS 2024 (Oral)