OMEGA:LLM 能否在数学中“出类拔萃”?评估探索性、组合性与变革性泛化
计算与语言
2025-06-24 v1 人工智能
摘要
近期大规模语言模型 (LLM),如 DeepSeek-R1,已在链式思考 (Chain-of-Thought) 推理方面取得显著成绩,尤其在奥林匹克级数学基准测试中表现突出。然而,这些模型常依赖狭窄的策略集合,面对需要新颖思考方式的问题时常力不从心。为系统性地探讨这些局限性,我们引入 OMEGA——“Out-of-distribution Math Problems Evaluation”(离散分布数学问题评估),设定三个泛化维度:(1)探索性——将已知问题解决技巧应用于更复杂的同一问题域实例;(2)组合性——将在孤立环境中学习的不同推理技巧组合,以全新且连贯的方式解决新问题;(3)变革性——通过超越熟悉方法,采用新颖或非常规策略更有效地解决问题。OMEGA 由程序化生成的训练-测试配对构成,基于模板化问题生成器,覆盖几何、数论、代数、组合、逻辑与谜题等领域,解答通过符号、数值或图形方法进行验证。我们评估了前沿 LLM,观察到随问题复杂度提升,性能呈现显著下降。此外,我们对 Qwen 系列模型在所有泛化设置下进行微调,发现探索性泛化有显著提升,而组合性泛化仍受限,变革性推理几乎无改善。通过细粒度地隔离与量化这些故障,OMEGA 为推动 LLM 向真正的数学创造力(超越机械熟练)奠定了基础。
引用
@article{arxiv.2506.18880,
title = {OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization},
author = {Yiyou Sun and Shawn Hu and Georgia Zhou and Ken Zheng and Hannaneh Hajishirzi and Nouha Dziri and Dawn Song},
journal= {arXiv preprint arXiv:2506.18880},
year = {2025}
}