展示别于说明:基于 ChildPlay 评估超大语言模型的文本理解之外能力
人工智能
2025-03-03 v5 计算与语言
摘要
我们开发了一个基准数据集,用于评估最新超大语言模型在语言任务之外问题的泛化能力,并在 GPT 模型系列 (GPT-3.5、GPT-4、GPT-4o、GPT-4o-mini) 上进行系统评估。使用 Tic-Tac-Toe、Connect Four、Battleship 和一种图形识别游戏等简单游戏(以 ASCII 编码),测试其战略能力和空间推理能力,这是人工智能掌握化学问题解决所需的核心能力。为探索泛化能力,我们引入两种新的空间逻辑游戏:LEGO Connect Language (LCL) 和 Guess-the-SMILES (GtS),作为一种操作简便的化学基准。我们的结果表明,GPT 模型在多个任务上提供了有意义的响应,但总体表现较差。仅在 4 个基准任务中观察到模型能力提升 (GPT-3.5、GPT-4、GPT-4o) 的系统性性能 progression。所有模型在 Battleship、LCL 和 GtS 上 consistently 表现不佳。这表明尽管 GPT 模型能够模拟对话语言能力和基本规则理解,但在战略和空间推理方面泛化能力有限。特别是在 ASCII 编码的分子图解释方面表现极差。我们公开的基准套件(<a href="https://github.com/BlueVelvetSackOfGoldPotatoes/child-play">\texttt{ChildPlay} GitHub 仓库</a>)的结果警示了 GPT 模型是否存在新兴智能的说法,这些模型似乎比通用智能更具专业化。
关键词
引用
@article{arxiv.2407.11068,
title = {Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay},
author = {Gonçalo Hora de Carvalho and Oscar Knap and Robert Pollice},
journal= {arXiv preprint arXiv:2407.11068},
year = {2025}
}