ZeroSumEval:基于模型间竞争扩展大语言模型评估
人工智能
2025-04-18 v1 计算与语言
摘要
大语言模型 (LLM) 的评估传统上依赖静态基准数据集、人类评估或模型评估方法——这些方法常常存在过拟合、高成本和偏见问题。ZeroSumEval 是一种基于竞赛的评估协议,利用零和博弈来评估 LLM,构建能够抵抗饱和的动态基准。ZeroSumEval 包含多样化的游戏集合,包括安全挑战 (PyJail)、经典游戏 (Chess、Liar's Dice、Poker)、知识测试 (MathQuiz) 和说服挑战 (Gandalf、Debate)。这些游戏旨在评估战略推理、规划、知识应用和创造力等各种 AI 能力。基于最近研究表明游戏评估对 LLM 有效性的成果,ZeroSumEval 通过提供标准化和可扩展框架来增强这些方法。为证明这一点,我们在 7 个游戏中进行了超过 7000 次模拟实验,涉及 13 个模型。我们的结果表明,虽然 GPT 和 Claude 系列的前沿模型能够玩常见游戏并回答问题,但它们在需要创造性且具有挑战性问题的游戏方面仍有挑战。我们还观察到模型无法可靠地相互破解彼此,通常在需要创造力的任务中表现不佳。我们在 https://github.com/facebookresearch/ZeroSumEval 上发布了代码。
引用
@article{arxiv.2504.12562,
title = {ZeroSumEval: Scaling LLM Evaluation with Inter-Model Competition},
author = {Haidar Khan and Hisham A. Alyahya and Yazeed Alnumay and M Saiful Bari and Bülent Yener},
journal= {arXiv preprint arXiv:2504.12562},
year = {2025}
}