Scheherazade:用于评估 LLM 中链式思考数学推理的框架
计算与语言
2025-02-26 v4
摘要
基准测试对于衡量大型语言模型(LLM)的推理能力至关重要。一些基准测试甚至成为衡量此类能力的事实标准。然而,随着 LLM 推理能力的提升,现有的广泛使用的基准测试如 GSM8K 仅能有限地衡量模型之间的推理差异——例如,大多数最先进的模型在 GSM8K 数据集上准确率已超过 94%(paperwithcode,2024)。虽然构建更难的基准测试是可能的,但其创建往往是手动进行的、昂贵的且不可扩展的。因此,我们提出了 Scheherazade,一种自动化方法,用于通过对小型初始问题集进行逻辑链式连接来生成大量具有挑战性的数学推理基准测试。我们提出了两种不同的链式方法,即正向链式和反向链式,其中包括随机分支技术以生成复杂的推理问题。我们将 Scheherazade 应用于 GSM8K,以创建 GSM8K-Scheherazade,并评估了 3 个前沿 LLM 以及 OpenAI 的 o1-preview。我们表明,虽然其他前沿模型在仅链式连接几个问题后性能急剧下降,但我们的评估表明 o1-preview 的性能持续存在——唯一在反向推理中表现更好的模型是标志性的 OpenAI 模型。我们的数据和代码均可在 https://github.com/YoshikiTakashima/scheherazade-code-data 提供。
引用
@article{arxiv.2410.00151,
title = {Scheherazade: Evaluating Chain-of-Thought Math Reasoning in LLMs with Chain-of-Problems},
author = {Stephen Miner and Yoshiki Takashima and Simeng Han and Sam Kouteili and Ferhat Erata and Ruzica Piskac and Scott J Shapiro},
journal= {arXiv preprint arXiv:2410.00151},
year = {2025}
}