对抗矩匹配蒸馏大语言模型
计算与语言
2024-06-06 v1 机器学习
摘要
知识蒸馏(KD)已被证明在引导学生模型(较大教师模型)方面非常有效,能够实现在大语言模型(LLM)中提高计算和内存效率的实际效益。目前用于LLM的SOTA蒸馏方法大多依赖最小化教师与学生概率预测之间的显式分布距离。我们不优化这些必需的行为克隆目标,而是探索LLM蒸馏的imitation学习策略。具体而言,我们通过匹配教师行为在/on-和off-policy视角下的所有动作价值矩来缩小imitation gap。为实现该动作价值矩匹配目标,我们提出了一种对抗训练算法,以联合估计矩匹配距离并优化学生策略以最小化该距离。来自任务无关指令遵循实验和任务特定实验的结果表明,我们的方法有效且实现了新的SOTA性能。
关键词
引用
@article{arxiv.2406.02959,
title = {Adversarial Moment-Matching Distillation of Large Language Models},
author = {Chen Jia},
journal= {arXiv preprint arXiv:2406.02959},
year = {2024}
}