中文

GameEval:基于对话游戏评估大语言模型

计算与语言 2023-08-22 v1

摘要

大语言模型(LLMs)的快速发展给模型评估带来了挑战。现有评估方法要么基于参考,要么基于偏好,不可避免地需要人工干预或引入由评估模型引发的测试偏差。本文中,我们提出 GameEval,一种通过目标驱动的对话游戏评估 LLMs 的新方法,克服了先前方法的局限。GameEval 将 LLMs 视为游戏玩家,并赋予其不同角色,通过发起包括讨论、问答与投票在内的多种形式对话来实现特定目标。我们设计了三款具有协作或对抗目标的独特游戏,并配以相应评估指标,以展示这一新范式如何全面评估模型表现。通过大量实验,我们表明 GameEval 能有效区分各类 LLMs 的能力,对其解决复杂问题的综合能力提供全面评估。我们的公开匿名代码见于 https://github.com/GameEval/GameEval。

关键词

引用

@article{arxiv.2308.10032,
  title  = {GameEval: Evaluating LLMs on Conversational Games},
  author = {Dan Qiao and Chenfei Wu and Yaobo Liang and Juntao Li and Nan Duan},
  journal= {arXiv preprint arXiv:2308.10032},
  year   = {2023}
}