大语言模型能够自我改进
计算与语言
2022-10-26 v2
摘要
大语言模型(LLMs)在各种任务中取得了优异表现。然而,微调 LLM 需要大量监督。另一方面,人类无需外部输入,可通过自我思考提升推理能力。本工作中,我们证明 LLM 仅借助无标签数据集也能自我改进。我们使用预训练 LLM,通过思维链提示(Chain-of-Thought prompting)与自一致性(self-consistency)为无标签问题生成“高置信度”的含原理答案,并将这些自生成解作为目标输出微调 LLM。我们表明,该方法提升了 540B 参数 LLM 的通用推理能力(GSM8K 上 74.4%→82.1%,DROP 上 78.2%→83.0%,OpenBookQA 上 90.0%→94.4%,ANLI-A3 上 63.4%→67.9%),并在无任何真实标签的情况下达到 SOTA 级别性能。我们进行了消融实验,表明对推理的微调对自我改进至关重要。
引用
@article{arxiv.2210.11610,
title = {Large Language Models Can Self-Improve},
author = {Jiaxin Huang and Shixiang Shane Gu and Le Hou and Yuexin Wu and Xuezhi Wang and Hongkun Yu and Jiawei Han},
journal= {arXiv preprint arXiv:2210.11610},
year = {2022}
}