面向小型LLM的数学推理通过预览难度感知干预增强
机器学习
2025-08-05 v1
摘要
强化学习扩展了大型语言模型的推理能力,强化学习是激发复杂推理能力的关键技术。然而,OpenAI O 系列、Claude 3 系列、DeepMind 的 Gemini 2.5 系列和 Grok 3 系列等最先进推理LLM的关键技术细节仍未公开,使得研究社区难以复制其强化学习训练结果。因此,我们从一个建立在开源GRPO框架上的早期预览强化学习(Early Preview Reinforcement Learning, EPRLI)算法入手,结合难度感知干预用于数学问题。应用于15亿参数的LLM后,我们的方法在AIME24上达到50.0%,在Math500上达到89.2%,在AMC上达到77.1%,在Minerva上达到35.3%,在OBench上达到51.9%,超越O1-Preview,在标准学校实验室环境下与O1-mini相当。
引用
@article{arxiv.2508.01604,
title = {Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention},
author = {Xinhan Di and JoyJiaoW},
journal= {arXiv preprint arXiv:2508.01604},
year = {2025}
}
备注
7 pages, 1 table, accepted by SIM ICML@2025 Workshop