中文

SATURN:基于 SAT 的强化学习解放 LLM 推理能力

机器学习 2026-03-11 v4 人工智能

摘要

如何设计有效释放大型语言模型 (LLM) 推理能力的强化学习 (RL) 任务 remains 一个开放问题。现有 RL 任务(如数学、编程和构建推理任务)存在三个关键局限性:(1) 可扩展性——依赖人工标注或高成本 LLM 生成大量训练数据;(2) 可验证性——LLM 输出难以自动可靠地验证;(3) 可控难度——大多数任务缺乏细粒度难度控制,难以引导 LLM 从易到难develop reasoning ability。为此,我们提出了 SATURN,一个基于 SAT 的 RL 框架,使用布尔满足问题 (SAT) 来训练和评估 LLM 推理。SATURN 实现了可扩展的任务构建、基于规则的验证和精确的难度控制。SATURN 设计了一套课程学习管道,通过构建难度逐渐提升的 SAT 任务,使 LLM 从易到难训练。为确保训练稳定,我们设计了一种原则化的机制来控制难度过渡。我们引入了 SATURN-2.6k,一个包含 2,660 个难度各异的 SAT 问题的数据集,支持评估 LLM 推理随问题难度变化的方式。我们将 SATURN 应用于 DeepSeek-R1-Distill-Qwen,获得了 SATURN-1.5B 和 SATURN-7B。我们取得了几个显著性结果:(1) 在 SAT 问题上,SATURN-1.5B 和 SATURN-7B 分别实现了平均 pass@3 提升 +14.0 和 +28.1;(2) 在数学和编程任务上,SATURN-1.5B 和 SATURN-7B 在基准(如 AIME、LiveCodeBench)上平均得分分别提升 +4.9 和 +1.8;(3) 与强化学习任务构建的 SOTA 方法相比,SATURN 进一步提升 +8.8%。我们发布了源码、数据和模型,以支持未来研究。

关键词

引用

@article{arxiv.2505.16368,
  title  = {SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning},
  author = {Huanyu Liu and Ge Li and Jia Li and Hao Zhu and Kechi Zhang and Yihong Dong},
  journal= {arXiv preprint arXiv:2505.16368},
  year   = {2026}
}

备注

Camera-ready version for Neural Information Processing Systems (NeurIPS) 2025, Spotlight Paper