中文

Aryabhata 2:扩展强化学习用于高级STEM推理

计算与语言 2026-05-29 v1 人工智能 计算机与社会

摘要

诸如JEE和NEET等竞争性STEM考试要求进行多步骤符号推理、精确数值计算以及对物理、化学和数学的深层概念理解。近期大语言模型在常见推理基准测试上表现良好,但在大规模部署时难以应对,数百万学生疑问需要特定领域、一致结构的问题求解。我们提出Aryabhata 2,一个专为竞争性STEM考试设计的推理导向语言模型,通过强化学习后训练实现。利用PhysicsWallah的内部题库,我们构建高质量训练课程,并通过可验证奖励对GPT-OSS-20B进行强化学习训练。训练结合延长的强化学习与通过逐步扩大的 rollout组大小实现的广泛探索。我们在竞争性考试基准测试(包括JEE Main、JEE Advanced和NEET)以及分布外推理数据集(AIME、HMMT、MMLU-Pro、MMLU-Redux 2.0和GPQA)上评估Aryabhata 2。结果表明,Aryabhata 2在竞争性STEM推理方面超越其基础模型GPT-OSS-20B,同时所需的输出token数显著减少(最高可减少64%)。

关键词

引用

@article{arxiv.2605.28829,
  title  = {Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning},
  author = {Ritvik Rastogi and Vishal Singh and Tejas Chaudhari and Sandeep Varma},
  journal= {arXiv preprint arXiv:2605.28829},
  year   = {2026}
}