中文

使用 GPT-4 进行指令微调

计算与语言 2023-04-07 v1 人工智能

摘要

先前的工作表明,使用机器生成的指令遵循数据对大型语言模型(LLM)进行微调,能够使此类模型在新任务上获得显著的零样本能力,且无需人工编写的指令。在本文中,我们首次尝试使用 GPT-4 为 LLM 微调生成指令遵循数据。我们在指令微调的 LLaMA 模型上的早期实验表明,由 GPT-4 生成的 52K 条英文和中文指令遵循数据,在新任务上的零样本性能优于先前 SOTA 模型生成的指令遵循数据。我们还收集了来自 GPT-4 的反馈和比较数据,以实现全面的评估和奖励模型训练。我们将使用 GPT-4 生成的数据以及我们的代码库公开提供。

关键词

引用

@article{arxiv.2304.03277,
  title  = {Instruction Tuning with GPT-4},
  author = {Baolin Peng and Chunyuan Li and Pengcheng He and Michel Galley and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2304.03277},
  year   = {2023}
}

备注

8 pages. Work in progress. Project page: https://instruction-tuning-with-gpt-4.github.io