弱到强推理
计算与语言
2024-10-02 v2 人工智能
摘要
当大语言模型(Large Language Models, LLMs)的能力超过人类水平时,提供全面且准确的监督变得日益困难。利用能力较弱的模型发掘更强模型潜在能力的弱到强学习(weak-to-strong learning)在此情境下证明具有价值。然而,针对复杂推理任务,该方法的有效性仍未得到充分检验。此外,当前在弱到强setting下解决推理任务缺乏高效方法,以避免盲目模仿弱监督者(包括其错误)。本文引入一种渐进式学习框架,使强模型能够自主完善其训练数据,无需来自更高级模型或人工标注数据。该框架首先对精选的小规模高质量数据集进行监督微调,随后对由强模型自身识别的对比样本进行偏好优化。针对GSM8K和MATH数据集上的大量实验表明,我们的方法显著提升了Llama2-70b使用三个独立弱模型的推理能力。该方法在前瞻性实验 setup 中进一步验证,即Llama3-8b-instruct有效监督Llama3-70b在OlympicArena数据集上的高难度任务。本工作为提升AI推理能力的更可扩展和更精细化策略之路。所有相关代码和资源均 available at \url{https://github.com/GAIR-NLP/weak-to-strong-reasoning}。
引用
@article{arxiv.2407.13647,
title = {Weak-to-Strong Reasoning},
author = {Yuqing Yang and Yan Ma and Pengfei Liu},
journal= {arXiv preprint arXiv:2407.13647},
year = {2024}
}
备注
EMNLP Findings 2024