中文

将 Codenames 作为大型语言模型的基准测试

人工智能 2025-04-23 v2 计算与语言

摘要

在本文中,我们提出使用流行的基于文字的棋盘游戏 Codenames 作为评估大型语言模型(LLMs)推理能力的合适基准测试。Codenames 为实现成功的 AI 性能提出了极具趣味的挑战,要求具备对语言的深入理解、心智理论和认识推理能力。先前开发 Codenames 智能体的尝试主要依赖于词嵌入技术,其词汇量范围有限,且在与不同方法配对时表现不佳。LLMs 已经展示出在基于语言的任务中增强的推理和理解能力,但在横向思维挑战中仍可能表现不佳。我们评估了多种最先进的 LLMs 的能力,包括 GPT-4o、Gemini 1.5、Claude 3.5 Sonnet 和 Llama 3.1,涵盖了多种棋盘设置。我们的结果表明,虽然某些 LLMs 总体上表现优于其他模型,但不同模型在游戏过程中表现出不同的涌现行为,并在特定角色上表现出色。我们还评估了不同 LLMs 组合在协同博弈时的性能,证明 LLM 智能体比先前技术更能泛化到更广泛的队友范围。

关键词

引用

@article{arxiv.2412.11373,
  title  = {Codenames as a Benchmark for Large Language Models},
  author = {Matthew Stephenson and Matthew Sidji and Benoît Ronval},
  journal= {arXiv preprint arXiv:2412.11373},
  year   = {2025}
}

备注

12 pages, 2 figures, 2 tables