迈向语言模型蒸馏中的容量鸿沟定律
计算与语言
2025-07-31 v4 人工智能
机器学习
摘要
语言模型(LM)蒸馏旨在将大型教师LM中的知识蒸馏至小型学生LM。作为LM蒸馏面临的关键问题,较优的学生模型往往源自规模相对较小的教师而非更大的教师,尤其在师生间存在显著容量鸿沟时。该问题常被称为\textit{容量鸿沟诅咒},表明在教师缩放过程中很可能存在一个最优教师可产出性能最佳的学生。因此,需对广泛尺度范围的教师进行蒸馏试验以确定最优教师,而在大语言模型(LLM)背景下此举计算开销巨大。本文通过从对广泛小规模(<3B)LMs蒸馏的初步研究中归纳出的\textit{容量鸿沟定律}来解决这一关键瓶颈,其中最优教师规模在不同模型与数据尺度下均与学生规模呈线性缩放。将该定律扩展至更大尺度(7B)的LLM蒸馏,我们成功获得了超越众多竞争对手的多功能LLM。
引用
@article{arxiv.2311.07052,
title = {Towards the Law of Capacity Gap in Distilling Language Models},
author = {Chen Zhang and Qiuchi Li and Dawei Song and Zheyu Ye and Yan Gao and Yan Hu},
journal= {arXiv preprint arXiv:2311.07052},
year = {2025}
}
备注
32 pages, 10 figures, 15 tables, accepted to ACL 2025. Code and checkpoints are available at https://github.com/GeneZC/MiniMA