REASONING GYM:面向具有可验证奖励的强化学习的推理环境
机器学习
2025-10-21 v2 人工智能
计算与语言
摘要
我们介绍了 Reasoning Gym (RG),这是一个用于具有可验证奖励的强化学习的推理环境库。它提供了超过 100 个数据生成器和验证器,涵盖多个领域,包括代数、算术、计算、认知、几何、图论、逻辑以及各种常见游戏。其关键创新在于能够生成复杂度可调的几乎无限的训练数据,这与大多数以往通常固定的推理数据集不同。这种程序化生成方法允许在不同难度级别上进行持续评估。我们的实验结果证明了 RG 在推理模型的评估和强化学习中的有效性。
引用
@article{arxiv.2505.24760,
title = {REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards},
author = {Zafir Stojanovski and Oliver Stanley and Joe Sharratt and Richard Jones and Abdulhakeem Adefioye and Jean Kaddour and Andreas Köpf},
journal= {arXiv preprint arXiv:2505.24760},
year = {2025}
}
备注
NeurIPS 2025 Spotlight. For code, see https://github.com/open-thought/reasoning-gym