中文

CoachLM:自动指令修订提升 LLM 指令微调中的数据质量

计算与语言 2024-03-22 v2

摘要

指令微调对使语言学习模型(LLM)响应人类指令至关重要。用于微调的指令对的质量极大影响 LLM 的性能。然而,人工创建高质量指令数据集成本高昂,导致采用 LLM 自动生成指令对作为流行替代方案。为确保 LLM 生成指令数据集的高质量,已提出若干方法。尽管如此,现有方法要么通过过滤大量样本损害数据集完整性,要么不适用于工业应用。本文中,我们不是丢弃低质量样本,而是提出 CoachLM,一种通过对数据集中样本进行自动修订来提升指令数据集质量的新方法。CoachLM 由人类专家修订的样本训练而来,将数据集中高质量样本的比例从 17.7% 显著提升至 78.9%。CoachLM 的有效性在多个实世界指令测试集上进一步评估。结果显示 CoachLM 将指令微调后 LLM 的指令遵循能力平均提升 29.9%,甚至超越参数量近乎两倍更大的 LLM。此外,CoachLM 已成功部署于华为的 LLM 数据管理系统中,在清洗 40k 实世界指令对时实现高达 20% 的效率提升。我们发布了 CoachLM 的多种资源,包括训练数据、代码与测试集(https://github.com/lunyiliu/CoachLM)。

关键词

引用

@article{arxiv.2311.13246,
  title  = {CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning},
  author = {Yilun Liu and Shimin Tao and Xiaofeng Zhao and Ming Zhu and Wenbing Ma and Junhao Zhu and Chang Su and Yutai Hou and Miao Zhang and Min Zhang and Hongxia Ma and Li Zhang and Hao Yang and Yanfei Jiang},
  journal= {arXiv preprint arXiv:2311.13246},
  year   = {2024}
}

备注

Accepted by ICDE 2024