中文

通过强化学习训练大语言模型进行逐步级自动数学纠正

计算与语言 2025-03-25 v1 人工智能 机器学习

摘要

自动数学纠正旨在通过人工智能技术检查学生的数学问题解答。目前大多数研究聚焦于在问题层面判断最终答案,忽略了对数学问题解决过程中每一步详细反馈的需求,这需要语义理解和推理能力。在本文中,我们提出了一种基于强化学习(RL)的方法,用于提升大语言模型(LLM)进行逐步级自动数学纠正能力,称为StepAMC。具体而言,我们将文本分类任务中的逐步级自动数学纠正转化为RL问题,以增强LLM的推理能力。然后,我们设计受空间约束的策略网络以提高RL的稳定性。随后,我们引入细粒度奖励网络,将二元人类反馈转换为连续价值。我们在两个基准数据集上进行大量实验,结果表明,该模型在所有基准上均优于十一组强基线。

关键词

引用

@article{arxiv.2503.18432,
  title  = {Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning},
  author = {Junsong Li and Jie Zhou and Yutao Yang and Bihao Zhan and Qianjun Pan and Yuyang Ding and Qin Chen and Jiang Bo and Xin Lin and Liang He},
  journal= {arXiv preprint arXiv:2503.18432},
  year   = {2025}
}