中文

ZeroSumEval:基于模型间竞争扩展 LLM 评估的框架

计算与语言 2025-04-18 v2 人工智能

摘要

我们介绍 ZeroSumEval,这是一个基于竞争游戏的动态、竞争性和不断演化的大型语言模型(LLM)评估框架。ZeroSumEval 包含多样化的游戏套件,包括安全挑战(捕获旗帜)、经典棋类游戏(象棋)和知识测试(MathQuiz)。这些游戏旨在评估各种能力,包括战略推理、计划、知识应用、安全性和适应性。基于最近研究表明游戏式评估对 LLM 效果显著,ZeroSumEval 通过提供标准化和可扩展框架,便于轻松实现各种游戏,并利用 DSPy 为 LLM 玩家策略提供更好的抽象。

关键词

引用

@article{arxiv.2503.10673,
  title  = {ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition},
  author = {Hisham A. Alyahya and Haidar Khan and Yazeed Alnumay and M Saiful Bari and Bülent Yener},
  journal= {arXiv preprint arXiv:2503.10673},
  year   = {2025}
}