AlpaGasus:以更少数据训练更优的 Alpaca
计算与语言
2024-02-14 v5
摘要
大语言模型(LLMs)通过在有监督指令/回答数据上进行指令微调(IFT)来强化指令遵循能力。然而,广泛使用的 IFT 数据集(例如 Alpaca 的 52k 数据)出人意料地包含许多带有不正确或无关回答的低质量样本,它们具有误导性且对 IFT 有害。本文中,我们提出一种简单而有效的数据选择策略,利用强 LLM(例如 ChatGPT)自动识别并过滤低质量数据。为此,我们引入了 AlpaGasus,它仅在从 52k Alpaca 数据中筛选出的 9k 高质量数据上微调。AlpaGasus 在多个测试集和受控人工评估中经 GPT-4 评测显著优于原始 Alpaca。其 13B 变体在测试任务上匹配了其教师 LLM(即生成 52k 数据的 Text-Davinci-003)超过 的性能。它还提供了 5.7 倍的更快训练,将 7B 变体的训练时间从 80 分钟(Alpaca)缩短至 14 分钟。此外,实验证明了我们的方法在多种数据集、基础模型和 LLM 过滤器上的有效性。总体而言,AlpaGasus 展示了一种新颖的以数据为中心的 IFT 范式,可普遍应用于指令微调数据,从而实现更快的训练与更优的指令遵循模型。我们的项目页面位于:https://lichang-chen.github.io/AlpaGasus/
引用
@article{arxiv.2307.08701,
title = {AlpaGasus: Training A Better Alpaca with Fewer Data},
author = {Lichang Chen and Shiyang Li and Jun Yan and Hai Wang and Kalpa Gunaratna and Vikas Yadav and Zheng Tang and Vijay Srinivasan and Tianyi Zhou and Heng Huang and Hongxia Jin},
journal= {arXiv preprint arXiv:2307.08701},
year = {2024}
}
备注
32 Pages; 29 Figures; 15 Tables