解码难题:大语言模型与人类解题者之比较
计算与语言
2023-10-26 v1 人机交互
摘要
本文通过评估大语言模型(LLMs)在难题(stumpers)上的表现来考察其问题解决能力;难题是一类独特的单步直觉问题,对人类求解者构成挑战但易于验证。我们将四种最先进LLMs(Davinci-2、Davinci-3、GPT-3.5-Turbo、GPT-4)的表现与人类参与者进行比较。结果发现,新一代LLMs擅长解决难题并超越人类表现;然而,人类在验证相同问题解答方面展现更优技能。本研究增进了我们对LLMs认知能力的理解,并为提升其在多领域的问题解决潜力提供见解。
引用
@article{arxiv.2310.16411,
title = {Decoding Stumpers: Large Language Models vs. Human Problem-Solvers},
author = {Alon Goldstein and Miriam Havin and Roi Reichart and Ariel Goldstein},
journal= {arXiv preprint arXiv:2310.16411},
year = {2023}
}