中文

无需训练亦能增益:以能量函数引导的蒙特卡洛树搜索释放大语言模型的数学推理能力

人工智能 2023-09-13 v3 机器学习

摘要

大语言模型(LLMs)展现出令人印象深刻的语言理解与上下文学习能力,使其适用于自然语言处理(NLP)任务与复杂数学推理。然而,当应用于数学推理任务时,尽管解具有高概率,LLMs 常难以生成正确的推理步骤与答案。为克服此局限并在无需额外微调步骤的情况下增强微调后 LLMs 的数学推理能力,我们提出一种方法,结合蒙特卡洛树搜索(MCTS)与轻量级能量函数,对决策步骤排序并实现即时反应与精确推理。具体而言,我们将微调后的 LLMs 重构为基于残差的能量模型(Residual-EBM),并采用噪声对比估计来估计能量函数的参数。随后我们利用以能量函数为路径验证器的 MCTS 搜索输出空间并评估推理路径。通过在 GSM8k 与 AQUA-RAT 两个数学推理基准上的大量实验,我们证明了本方法的卓越能力,其在无需额外微调或带人类反馈对齐的强化学习的情况下,显著提升了微调模型的 pass@1 指标。

关键词

引用

@article{arxiv.2309.03224,
  title  = {No Train Still Gain. Unleash Mathematical Reasoning of Large Language Models with Monte Carlo Tree Search Guided by Energy Function},
  author = {Haotian Xu},
  journal= {arXiv preprint arXiv:2309.03224},
  year   = {2023}
}

备注

still in progress