中文

Reflection-Tuning:数据回收改进 LLM 指令微调

计算与语言 2023-10-19 v1

摘要

大语言模型 (LLMs) 的近期进展拓展了自然语言理解与生成的边界。值得注意的是,LLM 的输出控制及其与输入的对齐可通过指令微调得以精炼。然而,如若干研究指出,训练集中的低质量数据通常不利于指令微调,导致 LLM 输出不一致甚至具误导性。我们提出一种称为“reflection-tuning”的新方法,通过 LLM 的自我改进与判断能力解决该问题。此方法利用一个 oracle LLM 对原始训练数据进行回收,通过内省并提升数据中指令与回复的质量。在广泛使用的评估基准上的大量实验表明,使用我们回收数据训练的 LLM 在各基准上均优于使用现有数据集训练的 LLM。

关键词

引用

@article{arxiv.2310.11716,
  title  = {Reflection-Tuning: Data Recycling Improves LLM Instruction-Tuning},
  author = {Ming Li and Lichang Chen and Jiuhai Chen and Shwai He and Heng Huang and Jiuxiang Gu and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2310.11716},
  year   = {2023}
}