中文

解码难题:大语言模型与人类解题者之比较

计算与语言 2023-10-26 v1 人机交互

摘要

本文通过评估大语言模型(LLMs)在难题(stumpers)上的表现来考察其问题解决能力;难题是一类独特的单步直觉问题,对人类求解者构成挑战但易于验证。我们将四种最先进LLMs(Davinci-2、Davinci-3、GPT-3.5-Turbo、GPT-4)的表现与人类参与者进行比较。结果发现,新一代LLMs擅长解决难题并超越人类表现;然而,人类在验证相同问题解答方面展现更优技能。本研究增进了我们对LLMs认知能力的理解,并为提升其在多领域的问题解决潜力提供见解。

关键词

引用

@article{arxiv.2310.16411,
  title  = {Decoding Stumpers: Large Language Models vs. Human Problem-Solvers},
  author = {Alon Goldstein and Miriam Havin and Roi Reichart and Ariel Goldstein},
  journal= {arXiv preprint arXiv:2310.16411},
  year   = {2023}
}