中文

我们在 LLM 决策方面走了多远?在多智能体环境中评估 LLM 的博弈能力

人工智能 2025-03-07 v7 计算与语言

摘要

决策是一个需要多种能力的复杂过程,使其成为评估大型语言模型(LLMs)的绝佳框架。研究人员已经通过博弈论的视角考察了 LLM 的决策能力。然而,现有的评估主要集中在 LLM 与另一个 LLM 竞争的双玩家场景。此外,先前的基准测试由于其静态设计而存在测试集泄露问题。我们引入了 GAMA(γ\gamma)-Bench,这是一个用于评估多智能体环境中 LLM 博弈能力的新框架。它包含八个经典博弈论场景和一个专门设计的动态评分方案,用于定量评估 LLM 的表现。γ\gamma-Bench 允许灵活的游戏设置,并使评分系统能够适应不同的游戏参数,从而能够全面评估鲁棒性、泛化能力以及改进策略。我们的结果表明,GPT-3.5 表现出强大的鲁棒性但泛化能力有限,这可以通过诸如思维链等方法来增强。我们还评估了来自 6 个模型系列的 13 个 LLM,包括 GPT-3.5、GPT-4、Gemini、LLaMA-3.1、Mixtral 和 Qwen-2。Gemini-1.5-Pro 优于其他模型,得分为 69.869.8(满分 100100),其次是 LLaMA-3.1-70B(65.965.9)和 Mixtral-8x22B(62.462.4)。我们的代码和实验结果公开于 https://github.com/CUHK-ARISE/GAMABench。

关键词

引用

@article{arxiv.2403.11807,
  title  = {How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments},
  author = {Jen-tse Huang and Eric John Li and Man Ho Lam and Tian Liang and Wenxuan Wang and Youliang Yuan and Wenxiang Jiao and Xing Wang and Zhaopeng Tu and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2403.11807},
  year   = {2025}
}

备注

Accepted to ICLR 2025; 11 pages of main text; 26 pages of appendices; Included models: GPT-3.5-{0613, 1106, 0125}, GPT-4-0125, GPT-4o-0806, Gemini-{1.0, 1.5)-Pro, LLaMA-3.1-{7, 70, 405}B, Mixtral-8x{7, 22}B, Qwen-2-72B