中文

创意或蛮力?基于脑筋急转盲测评大型语言模型的问题解决能力

人工智能 2025-10-30 v4 计算与语言

摘要

准确率是评估 AI 系统的标准指标,但仅能提供有限关于模型如何得出解答的见解。本文引入一种基于脑筋急转盲(brainteasers)编写的长篇叙述性基准测试,以探究模型使用的推理策略。脑筋急转盲适合此目标,因为它们可以采用多种方法求解:一种是使用创意洞察的少步骤解法,另一种是使用更多蛮力的较长解法。我们调查了大型语言模型(LLM)在多个推理层面,关注不仅正确性,还关注解答的质量和创造性。我们调查了推理过程的多个方面:(1)将脑筋急转盲语义解析为精确的数学竞赛格式;(2)从这些数学形式生成解答;(3)基于黄金解答进行自我纠正;(4)生成解答的逐步草图;(5)利用提示(hints)。我们发现,许多情况下 LLM 能够找到创意、富有洞察力的脑筋急转盲解答,表明它们捕捉了解决新问题以创造性方式求解所需能力的某些方面。然而,仍也存在一些情况是 LLM 尽管存在更高效、更具创造性的解答,却依赖于蛮力,这凸显了 LLM 推理能力提升的潜在方向。

关键词

引用

@article{arxiv.2505.10844,
  title  = {Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models},
  author = {Simeng Han and Howard Dai and Stephen Xia and Grant Zhang and Chen Liu and Lichang Chen and Hoang Huy Nguyen and Hongyuan Mei and Jiayuan Mao and R. Thomas McCoy},
  journal= {arXiv preprint arXiv:2505.10844},
  year   = {2025}
}

备注

NeurIPS 2025