面向大语言模型蒸馏的多样性感知逆 KL 散度
机器学习
2026-04-02 v1 人工智能
摘要
逆 KL 散度(Reverse Kullback-Leibler divergence)近期成为大语言模型(LLM)蒸馏的首选目标,在大词汇表和显著的教师-学生容量不匹配等场景中始终优于前向 KL(FKL),因为 RKL 将学习聚焦于主导模式而非强制密集对齐。然而,RKL 引入了一种结构性限制,驱动学生模型产生过度自信的预测。我们首先通过将 RKL 的梯度分解为目标和非目标分量来分析 RKL,发现即使在学生已经匹配教师的情况下,非目标梯度也持续将目标 logit 向上推,从而降低输出多样性。此外,RKL 对非目标类别提供的监督较弱,导致尾部对齐不佳。为解决这些问题,我们提出了多样性感知 RKL(DRKL),该方法消除了上述梯度效应并加强了对非目标类别的监督,同时保留了 RKL 的优化优势。在跨数据集和模型族的广泛实验中,DRKL 始终优于 FKL、RKL 和其他最先进的蒸馏目标,在性能和保真度-多样性权衡上均取得了更优表现。
引用
@article{arxiv.2604.00223,
title = {Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation},
author = {Hoang-Chau Luong and Dat Ba Tran and Lingwei Chen},
journal= {arXiv preprint arXiv:2604.00223},
year = {2026}
}