狼人竞技场:通过社交推理进行大语言模型评估的案例研究
计算与语言
2024-07-22 v1 人工智能
摘要
本文介绍了狼人竞技场(Werewolf Arena),一个通过经典社交推理游戏“狼人杀”来评估大语言模型(LLM)的新颖框架。在狼人竞技场中,LLM相互竞争,应对游戏中欺骗、推理和说服的复杂动态。该框架引入了一种基于竞价的动态轮转机制,模拟了现实世界中个体策略性选择发言时机的讨论场景。我们通过一场包含Gemini和GPT模型的竞技场式锦标赛,展示了该框架的实用性。结果揭示了这些模型在策略推理和沟通方面的不同优势与劣势。这些发现凸显了狼人竞技场作为一个具有挑战性且可扩展的LLM基准的潜力。
引用
@article{arxiv.2407.13943,
title = {Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction},
author = {Suma Bailis and Jane Friedhoff and Feiyang Chen},
journal= {arXiv preprint arXiv:2407.13943},
year = {2024}
}
备注
13 pages, 10 figures