中文

通过批判模型增强 LLM 推理能力:基于测试时与训练时的监督

计算与语言 2024-11-26 v1 人工智能 机器学习

摘要

训练大型语言模型(LLM)在作答前花费更多时间进行思考和反思对于有效解决科学、编码和数学等领域的复杂推理任务至关重要。然而,诸如自反思和自纠错等机制的有效性取决于模型准确评估自身性能的能力,这可能受到初始准确率、问题难度以及缺乏外部反馈等因素的限制。本文提出一种两玩家范式,分离推理与批判模型的角色,其中批判模型在测试时和训练时为监督推理(演员)模型提供逐步级别的反馈。我们首先提出 AutoMathCritique—a 一个自动且可扩展的框架,用于收集批判数据, resulting in a dataset of 76,32176,321 responses paired with step-level feedback。通过该数据集微调语言模型后,模型能够为数学推理生成自然语言反馈。我们证明,批判模型在测试时对演员在困难查询上的表现具有一致性改善,尤其是在扩大推理时间计算后。受此启发,我们将批判式监督引入演员的自训练过程中,提出一种批判在环自我改进方法。实验表明,该方法提高了演员的探索效率和解题多样性,尤其是在挑战性查询上,从而培养出更强大的推理模型。最后,我们初步探索了通过批判监督训练自言自语推理模型的可能性,并展示了其潜力。我们的代码和数据集位于 \href{https://mathcritique.github.io/}{https://mathcritique.github.io/}。

关键词

引用

@article{arxiv.2411.16579,
  title  = {Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision},
  author = {Zhiheng Xi and Dingwen Yang and Jixuan Huang and Jiafu Tang and Guanyu Li and Yiwen Ding and Wei He and Boyang Hong and Shihan Do and Wenyu Zhan and Xiao Wang and Rui Zheng and Tao Ji and Xiaowei Shi and Yitao Zhai and Rongxiang Weng and Jingang Wang and Xunliang Cai and Tao Gui and Zuxuan Wu and Qi Zhang and Xipeng Qiu and Xuanjing Huang and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2411.16579},
  year   = {2024}
}

备注

Preprint