中文

基于迭代偏好学习提升蒙特卡洛树搜索驱动推理内在自我纠错能力

机器学习 2024-12-24 v1 计算机视觉与模式识别

摘要

针对当前通过 AlphaZero 启发式的迭代偏好学习方法旨在提升大型语言模型(LLM)推理能力的挑战,我们进一步通过内在自我纠错在某种程度上提升步骤级推理能力。我们的工作利用步骤级偏好学习来增强自我验证,通过强化学习实现。我们最初通过两阶段训练程序进行工作。在第一阶段,通过其自身预测(在某种程度上依赖于内在自我纠错)来增强 LLM 的自我纠错推理能力。第二阶段,应用在第一阶段获得的增强自我纠正策略,利用基准步骤级偏好学习。在算术推理任务的评估中,我们的方法在 OpenMath2-Llama3.1-8B 上超越了 dart-math-mistral-7b-uniform,在 MATH 上实现了准确率提升至 71.34%(+4.18%)和 48.06%(+4.94%),在 LLaMA-3.1-8B-Instruct、Mistral-7B-Instruct-v0.1 上在 GSM8K 上实现了准确率提升至 86.76%(+2.00%)和 38.06%(+2.28%)。

关键词

引用

@article{arxiv.2412.17397,
  title  = {Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning},
  author = {Huchen Jiang and Yangyang Ma and Chaofan Ding and Kexin Luan and Xinhan Di},
  journal= {arXiv preprint arXiv:2412.17397},
  year   = {2024}
}

备注

6 Pages,3 figures, accepted by AAAI 2025 Workshop NeurMAD