中文

长即是对齐之优:指令微调中简单却难被超越的基线

计算与语言 2024-06-05 v2

摘要

学界共识认为大语言模型 (LLM) 的指令微调需要高质量数据,但何为高质量数据?LIMA (NeurIPS 2023) 和 AlpaGasus (ICLR 2024) 是通过人工策划或使用 GPT-3.5-Turbo 作为质量评分器来选择此类高质量示例的最先进方法。我们表明,从标准数据集中选择响应最长的 1,000 条指令这一极其简单的基线——直观上包含更多可学习信息且更难过拟合——在由 GPT-4 和 PaLM-2 作为评判者时,能持续优于这些复杂方法,同时在测试事实知识的 Open LLM 基准上保持竞争力。我们在多个 LLM(Llama-2-7B、Llama-2-13B、Mistral-7B-v0.1)和数据集(Alpaca-52k、Evol-Instruct-70k)上证明了这一点。此外,对此类长指令进行轻量级 refinement 可进一步提升微调后 LLM 的能力,使我们仅在 1,000 个示例且无额外偏好数据的情况下,在 MT-Bench 上获得竞争性结果,并在 AlpacaEval 2.0 上成为排名第二的基于 Llama-2-7B 的模型。我们还对模型进行了彻底分析,以确保其性能提升并非单纯源于 GPT-4 对较长响应的偏好。总体而言,我们的发现表明,基于最长响应进行微调应成为任何指令微调工作的默认基线。代码地址:https://github.com/tml-epfl/long-is-more-for-alignment。

关键词

引用

@article{arxiv.2402.04833,
  title  = {Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-Tuning},
  author = {Hao Zhao and Maksym Andriushchenko and Francesco Croce and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2402.04833},
  year   = {2024}
}

备注

Accepted at ICML 2024. This camera-ready version adds MT-Bench evaluations, a human study, more thorough analysis of length bias. Code at https://github.com/tml-epfl/long-is-more-for-alignment