中文

通过自动化 PRM 引导的 GFlowNets 实现 LLM 数学推理的精准性与多样性

机器学习 2025-10-14 v3 计算与语言

摘要

在数学等复杂领域中,实现大语言模型(LLM)的准确率与多样推理仍具有挑战性。关键瓶颈在于评估中间推理步骤,以指导生成而不依赖高昂的人工标注。为此,我们首次引入一种新型过程奖励模型(PRM),通过蒙特卡洛树搜索(Monte Carlo Tree Search)结合基于相似性的数据增强技术进行自动训练,有效捕捉步骤级推理质量。借助该 PRM,我们随后将生成式流网络(GFlowNets)适用于推理步骤级别。不同于传统强化学习仅聚焦于最大化单一奖励,GFlowNets 能自然地按其奖励比例对样本进行多样化、高质量解决方案采样,这些奖励由我们的 PRM 衡量。经验评估显示,在具有挑战性的数学基准测试中,准确率和解决方案多样性均取得显著提升(例如,在 MATH Level 5 上使用 Llama3.2-3B 模型时,准确率提升了 2.59%),且对未见数据集具有有效泛化(SAT MATH 上提升了 9.4%)。此外,我们对比评估了 PRM 与现有开源奖励模型的表现,证明其在推理质量对齐性和下游生成指导一致性方面均优于现有方法。我们的工作展示了 PRM 指导下的、步骤级 GFlowNets 在提升 LLM 数学推理鲁健性和通用性方面的潜力。

关键词

引用

@article{arxiv.2504.19981,
  title  = {Accurate and Diverse LLM Mathematical Reasoning via Automated PRM-Guided GFlowNets},
  author = {Adam Younsi and Ahmed Attia and Abdalgader Abubaker and Mohamed El Amine Seddik and Hakim Hacid and Salem Lahlou},
  journal= {arXiv preprint arXiv:2504.19981},
  year   = {2025}
}