中文

面向小型LLM的数学推理通过预览难度感知干预增强

机器学习 2025-08-05 v1

摘要

强化学习扩展了大型语言模型的推理能力,强化学习是激发复杂推理能力的关键技术。然而,OpenAI O 系列、Claude 3 系列、DeepMind 的 Gemini 2.5 系列和 Grok 3 系列等最先进推理LLM的关键技术细节仍未公开,使得研究社区难以复制其强化学习训练结果。因此,我们从一个建立在开源GRPO框架上的早期预览强化学习(Early Preview Reinforcement Learning, EPRLI)算法入手,结合难度感知干预用于数学问题。应用于15亿参数的LLM后,我们的方法在AIME24上达到50.0%,在Math500上达到89.2%,在AMC上达到77.1%,在Minerva上达到35.3%,在OBench上达到51.9%,超越O1-Preview,在标准学校实验室环境下与O1-mini相当。

关键词

引用

@article{arxiv.2508.01604,
  title  = {Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention},
  author = {Xinhan Di and JoyJiaoW},
  journal= {arXiv preprint arXiv:2508.01604},
  year   = {2025}
}

备注

7 pages, 1 table, accepted by SIM ICML@2025 Workshop