学习排序链式思维:使用小模型
机器学习
2025-10-02 v3 人工智能
计算与语言
机器学习
摘要
大型语言模型(LLM)在可靠的数学推理方面存在困难,当前的验证方法往往计算成本高昂。本文引入能量结果奖励模型(EORM),这是一种高度高效、轻量级的事后验证器,用于缓解这一挑战。EORM基于能量框架对链式思维(CoT)解进行排序,通过仅使用简单的结果标签学习区分正确与错误推理,从而无需昂贵的标注。该模型仅需5500万参数,约是典型奖励模型规模的1/127,使 Llama 3 8B 在 GSM8k 上的准确率提升至90.7%,在 MATH 上的准确率提升至63.7%。通过从候选解集中高效选择最优推理路径,EORM 能够匹配或超越更为资源密集的Best-of-N抽样技术。关键在于,我们的实验表明,EORM 对分布外问题和未见模型具有良好的概括能力,表明其学习到了有效推理的基本原理。这种鲁棒性与高效性结合,使EORM 成为在复杂真实场景中部署更可靠LLM的实用工具。
引用
@article{arxiv.2505.14999,
title = {Learning to Rank Chain-of-Thought: Using a Small Model},
author = {Eric Hanchen Jiang and Haozheng Luo and Shengyuan Pang and Xiaomin Li and Zhenting Qi and Hengli Li and Cheng-Fu Yang and Zongyu Lin and Xinfeng Li and Hao Xu and Kai-Wei Chang and Ying Nian Wu},
journal= {arXiv preprint arXiv:2505.14999},
year = {2025}
}