ZeroSumEval:基于模型间竞争扩展 LLM 评估的框架
计算与语言
2025-04-18 v2 人工智能
摘要
我们介绍 ZeroSumEval,这是一个基于竞争游戏的动态、竞争性和不断演化的大型语言模型(LLM)评估框架。ZeroSumEval 包含多样化的游戏套件,包括安全挑战(捕获旗帜)、经典棋类游戏(象棋)和知识测试(MathQuiz)。这些游戏旨在评估各种能力,包括战略推理、计划、知识应用、安全性和适应性。基于最近研究表明游戏式评估对 LLM 效果显著,ZeroSumEval 通过提供标准化和可扩展框架,便于轻松实现各种游戏,并利用 DSPy 为 LLM 玩家策略提供更好的抽象。
关键词
引用
@article{arxiv.2503.10673,
title = {ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition},
author = {Hisham A. Alyahya and Haidar Khan and Yazeed Alnumay and M Saiful Bari and Bülent Yener},
journal= {arXiv preprint arXiv:2503.10673},
year = {2025}
}