中文

选择性反思微调:用于大语言模型指令微调的学生自选数据循环

计算与语言 2024-06-11 v2 人工智能 机器学习

摘要

指令微调对于大语言模型(LLM)实现更好的指令遵循和任务适应能力至关重要,但其成功高度依赖于训练数据的质量。许多近期方法专注于提高数据质量,但往往忽视了数据与待微调学生模型的兼容性。本文介绍了选择性反思微调(Selective Reflection-Tuning),这是一种新颖的范式,它协同教师 LLM 的反思与内省以改善现有数据质量,以及学生 LLM 的数据选择能力,从而自动优化现有的指令微调数据。这种师生协作产生了高质量且与学生兼容的指令 - 响应对,实现了样本高效的指令微调和性能卓越的 LLM。选择性反思微调是一种数据增强与合成方法,无需收集全新数据即可普遍提升 LLM 的微调与自我改进能力。我们将该方法应用于 Alpaca 和 WizardLM 数据,取得了更强且处于顶尖水平的 7B 和 13B LLM。

关键词

引用

@article{arxiv.2402.10110,
  title  = {Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning},
  author = {Ming Li and Lichang Chen and Jiuhai Chen and Shwai He and Jiuxiang Gu and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2402.10110},
  year   = {2024}
}

备注

ACL2024 (findings), Camera-ready