GFlowNet精调:用于数学推理任务中多样正确解
机器学习
2024-10-29 v1
摘要
数学推理问题因需要理解基本法则来解决而属于最具挑战性的任务。这些法则是普适的,但最终答案的推导方式取决于问题的具体求解方法。当训练大型语言模型(LLM)时,学习生成多种解决方案的能力对于加快其在数学教育中的应用至关重要。为此,我们采用生成流网络(GFlowNet)进行训练。与奖励最大化强化学习(RL)不同,GFlowNet精调通过训练LLM,其分布与奖励函数成比例,以寻找多样化的解决方案。在数值实验中,我们评估了GFlowNet精调和奖励最大化RL在准确率和多样性方面的表现。结果表明,GFlowNet精调能够从多样化的中间推理步骤中导出正确的最终答案,表明其在生成备选解的能力方面取得了提升。
引用
@article{arxiv.2410.20147,
title = {GFlowNet Fine-tuning for Diverse Correct Solutions in Mathematical Reasoning Tasks},
author = {Ryoichi Takase and Masaya Tsunokake and Yuta Tsuchiya and Shota Inuzuka},
journal= {arXiv preprint arXiv:2410.20147},
year = {2024}
}