连接点:使用《纽约时报》Connections 单词游戏评估 LLM 的抽象推理能力
计算与语言
2024-10-15 v7 人工智能
摘要
《纽约时报》Connections 游戏作为一种流行且具有挑战性的单词解谜活动日益流行。我们收集了 438 场 Connections 游戏,以评估最先进的大语言模型 (LLM) 相对于专家和初学者人类的表现。我们的结果显示,尽管表现最佳的 LLM——Claude 3.5 Sonnet 在各种基准测试中展现了惊人的推理能力,但它只能完全解决 18% 的游戏。初学者和专家玩家的表现优于 Claude 3.5 Sonnet,其中专家人类玩家显著优于它。我们创建了一种知识类型分类体系,用于成功对游戏中的单词进行聚类和分类。我们发现,尽管 LLMs 在基于语义关系对单词进行分类方面表现相对较好,但在处理其他类型的知识时则感到困难,例如百科全书式知识、多词表达式或结合 Word Form 和 Meaning 的知识。我们的结果将《纽约时报》Connections 游戏确立为评估 AI 系统抽象推理能力的具有挑战性的基准。
关键词
引用
@article{arxiv.2406.11012,
title = {Connecting the Dots: Evaluating Abstract Reasoning Capabilities of LLMs Using the New York Times Connections Word Game},
author = {Prisha Samadarshi and Mariam Mustafa and Anushka Kulkarni and Raven Rothkopf and Tuhin Chakrabarty and Smaranda Muresan},
journal= {arXiv preprint arXiv:2406.11012},
year = {2024}
}