Instruct-SkillMix:强大的LLM指令调优管道
机器学习
2025-07-08 v4 计算与语言
摘要
我们介绍 Instruct-SkillMix,这是一种自动化创建多样化高质量 SFT 数据的方法,用于指令跟随。该管道包含两个阶段,每个阶段都利用现有的强大 LLM:(1) 技能提取:使用 LLM 从模型直接提示中提取指令跟随的核心“技能”。这灵感来自 Didolkar 等人 (2024) 的“LLM 元认知”;(2) 数据生成:使用强大的 LLM 生成(指令,响应)数据,这些数据表现出随机选择的这些技能的配对。这里,随机技能组合的使用促进了多样性和难度。创建该数据集的估计成本低于 600 美元。对从 Instruct-SkillMix 生成的数据进行的 vanilla SFT(即不使用 PPO、DPO 或 RL 方法)在指令跟随基准测试(如 AlpacaEval 2.0、MT-Bench 和 WildBench)上取得显著成果。仅用 4K 个示例,LLaMA-3-8B-Base 就能在 AlpacaEval 2.0 上实现 42.76% 的长度控制获胜率,水平与前沿模型如 Claude 3 Opus 和 LLaMA-3.1-405B-Instruct 相当。消融研究还表明,通过笨拙的众包方式创建开放指令调优数据集困难的合理原因。我们的数据中添加 20% 的低质量回答(“懈怠者”)会导致性能明显下降。Instruct-SkillMix 管道在其他setting 中似乎灵活且可适应。
引用
@article{arxiv.2408.14774,
title = {Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning},
author = {Simran Kaur and Simon Park and Anirudh Goyal and Sanjeev Arora},
journal= {arXiv preprint arXiv:2408.14774},
year = {2025}
}