中文

对抗矩匹配蒸馏大语言模型

计算与语言 2024-06-06 v1 机器学习

摘要

知识蒸馏(KD)已被证明在引导学生模型(较大教师模型)方面非常有效,能够实现在大语言模型(LLM)中提高计算和内存效率的实际效益。目前用于LLM的SOTA蒸馏方法大多依赖最小化教师与学生概率预测之间的显式分布距离。我们不优化这些必需的行为克隆目标,而是探索LLM蒸馏的imitation学习策略。具体而言,我们通过匹配教师行为在/on-和off-policy视角下的所有动作价值矩来缩小imitation gap。为实现该动作价值矩匹配目标,我们提出了一种对抗训练算法,以联合估计矩匹配距离并优化学生策略以最小化该距离。来自任务无关指令遵循实验和任务特定实验的结果表明,我们的方法有效且实现了新的SOTA性能。

关键词

引用

@article{arxiv.2406.02959,
  title  = {Adversarial Moment-Matching Distillation of Large Language Models},
  author = {Chen Jia},
  journal= {arXiv preprint arXiv:2406.02959},
  year   = {2024}
}