基于任务感知课程规划的大语言模型指令跟随能力蒸馏
计算与语言
2024-10-04 v2
摘要
指令调谐旨在将大型语言模型(LLM)与开放领域指令及人类偏好响应对齐。虽然已有多项研究探索了从强大的专有LLM(如ChatGPT)中自主蒸馏和标注指令的方法,但这些方法往往忽视了训练集中指令分布、特征以及难度差异的影响。这会导致学生LLM知识能力不平衡、泛化能力较差。为解决这些挑战,本文引入任务感知课程规划用于指令精炼(TAPIR),这是一种多轮蒸馏框架,利用oracle LLM选择学生LLM跟随困难的指令。为平衡学生能力,调整训练集中的任务分布,并根据对应任务自动精炼响应。此外,通过纳入课程规划,该方法系统性地提升任务难度,逐步增强学生LLM的能力。我们严格评估了TAPIR,使用多个广泛认可的基准(如AlpacaEval 2.0、MT-Bench等)以及多个学生LLM。实证结果表明,使用我们的方法且训练数据更少的学生LLM,能够超越更大的指令调谋模型和强大的蒸馏基线。
引用
@article{arxiv.2405.13448,
title = {Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planning},
author = {Yuanhao Yue and Chengyu Wang and Jun Huang and Peng Wang},
journal= {arXiv preprint arXiv:2405.13448},
year = {2024}
}
备注
emnlp 2024 findings