Enigmata:利用合成可验证谜题扩展大型语言模型的逻辑推理
计算与语言
2025-06-10 v2 人工智能
摘要
大型语言模型,如 OpenAI 的 o1 和 DeepSeek 的 R1,通过带可验证奖励的强化学习在数学和编程等高级推理任务中表现出色,但在人类无需领域知识即可解开的谜题上仍然存在困难。我们引入了 Enigmata,这是首个为提升 LLMs 谜题推理技能而量身定制的综合套件。它包含 7 个类别的 36 项任务,每项任务均包含:1) 一个可生成具有可控难度的无限示例的生成器,以及 2) 一个用于自动评估的基于规则的验证器。这种生成器-验证器设计支持可扩展的多任务 RL 训练、细粒度分析以及无缝的 RLVR 集成。我们进一步提出了 Enigmata-Eval,一个严格的基准测试,并开发了优化的多任务 RLVR 策略。我们训练的模型 Qwen2.5-32B-Enigmata 在谜题推理基准测试上持续超越 o3-mini-high 和 o1,如 Enigmata-Eval、ARC-AGI (32.8\%) 和 ARC-AGI 2 (0.6\%)。它也能很好地泛化到域外谜题基准测试和数学推理,且几乎没有多任务权衡。当在像 Seed1.5-Thinking(200亿激活参数和2000亿总参数)这样的大型模型上进行训练时,来自 Enigmata 的谜题数据进一步提升了在高级数学和 STEM 推理任务(如 AIME (2024-2025)、BeyondAIME 和 GPQA (Diamond))上的 SoTA 性能,展示了 Enigmata 良好的泛化收益。这项工作为推进 LLMs 的逻辑推理提供了一个统一、可控的框架。本工作的资源可在 https://seed-enigmata.github.io 找到。
引用
@article{arxiv.2505.19914,
title = {Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles},
author = {Jiangjie Chen and Qianyu He and Siyu Yuan and Aili Chen and Zhicheng Cai and Weinan Dai and Hongli Yu and Qiying Yu and Xuefeng Li and Jiaze Chen and Hao Zhou and Mingxuan Wang},
journal= {arXiv preprint arXiv:2505.19914},
year = {2025}
}