背后是复述还是推理? cutting-edge语言模型在小学水平推理问题中的表现
人工智能
2025-11-04 v3 计算与语言
机器学习
摘要
近年来,LLM基准测试中问题难度的快速升级,让研究人员惊叹于我们距离超越人类智慧仅仅相距一步之遥。然而,LLM的卓越推理能力是否真的来自人类标准下的智慧,或者仅仅是机械复述在互联网级别训练中看到的解决方案?为研究此问题,本文提出了RoR-Bench,一个用于检测LLM在简单推理问题(但条件略有变化)时表现出复述行为的新型多模态基准测试,并对该基准进行了经验分析。令人惊讶的是,我们发现现有的前沿LLM普遍表现出严重的复述行为;当条件中的一个词句发生变化时,像OpenAI-o1和DeepSeek-R1等顶级模型在小学水平的算术和推理问题上可能受损高达60%。这些发现是对LLM社区的警醒,迫使我们重新评估前沿LLM的真实智能水平。
引用
@article{arxiv.2504.00509,
title = {Recitation over Reasoning: How Cutting-Edge Language Models Can Fail on Elementary School-Level Reasoning Problems?},
author = {Kai Yan and Yufei Xu and Zhengyin Du and Xuesong Yao and Zheyu Wang and Xiaowen Guo and Jiecao Chen},
journal= {arXiv preprint arXiv:2504.00509},
year = {2025}
}
备注
24 pages, 3 figures, 13 tables. The paper is accepted at AACL-IJCNLP 2025 (main track), and the latest version adds modifications in camera-ready