中文

AutoLogi:用于评估大语言模型推理能力的逻辑谜题自动生成

计算与语言 2025-02-25 v1

摘要

尽管大语言模型(LLMs)的逻辑推理评估引起了广泛关注,但现有的基准测试主要依赖于容易受随机猜测影响的选择题格式,导致性能被高估并出现大幅波动。为了更准确地评估模型的推理能力,我们提出了一种自动合成开放式逻辑谜题的方法,并利用该方法开发了一个双语基准测试 AutoLogi。我们的方法具有基于程序的验证和可控的难度级别,能够实现更可靠的评估,从而更好地区分模型的推理能力。对八个现代 LLMs 的广泛评估表明,AutoLogi 能更好地反映模型的真实能力,其性能得分跨度为 35% 到 73%,而原始选择题数据集上的得分跨度较窄,仅为 21% 到 37%。除了创建基准测试外,该合成方法还可以通过将程序验证器纳入拒绝采样过程来生成高质量的训练数据,从而实现对 LLMs 在不同数据集上推理能力的系统性提升。

关键词

引用

@article{arxiv.2502.16906,
  title  = {AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models},
  author = {Qin Zhu and Fei Huang and Runyu Peng and Keming Lu and Bowen Yu and Qinyuan Cheng and Xipeng Qiu and Xuanjing Huang and Junyang Lin},
  journal= {arXiv preprint arXiv:2502.16906},
  year   = {2025}
}