BattleAgentBench:用于评估语言模型在多智能体系统中合作与竞争能力的基准
计算与语言
2024-08-29 v1
摘要
大型语言模型(LLMs)正变得越来越强大和能处理复杂任务,例如构建单个智能体和多智能体系统。与单个智能体相比,多智能体系统对语言模型的协作能力要求更高。已提出许多基准来评估它们的协作能力。然而,这些基准缺乏对语言模型协作能力的细粒度评估。此外,现有工作忽略了多智能体协作和竞争情景。为解决这两个问题,我们提出了一个基准,称为BattleAgentBench,它定义了三个不同难度级别的七个子阶段,对语言模型在单智能体情景导航能力、配对智能体任务执行能力以及多智能体协作与竞争能力方面进行细粒度评估。我们对领先的四个封闭源模型和七个开源模型进行了广泛评估。实验结果表明,API 基于模型在简单任务中表现优异,但开源小模型在简单任务中仍感到挑战。就需要协作与竞争能力的困难任务而言,尽管 API 基于模型已展示出一些协作能力,但仍有巨大的提升空间。
引用
@article{arxiv.2408.15971,
title = {BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems},
author = {Wei Wang and Dan Zhang and Tao Feng and Boyan Wang and Jie Tang},
journal= {arXiv preprint arXiv:2408.15971},
year = {2024}
}