循师足迹:面向领域特定LLM的定时检查点蒸馏
人工智能
2026-01-16 v1
摘要
大型语言模型(LLM)因其庞大的规模而难以部署于领域特定任务。虽然将微调后的LLM蒸馏为更小的学生模型是一种有前景的替代方案,但教师与学生之间的能力差距常常导致次优性能。这引出了一个关键问题:学生模型何时以及如何能在领域特定任务上匹敌甚至超越其教师?在这项工作中,我们提出了一个新颖的理论见解:如果学生在学生偏好子域(SFS)上的优势超过其在教师偏好子域(TFS)上的劣势,那么学生可以超越其教师。在此见解的指导下,我们提出了定时检查点蒸馏(SCD),通过在领域任务上的监督微调(SFT)过程中模拟教师的收敛过程来减少TFS劣势,并提出了一种样本级自适应加权(AW)机制以保持学生在SFS上的优势。跨多种领域任务的实验——包括多语言的问答、命名实体识别和文本分类——表明,我们的方法始终优于现有的蒸馏方法,使学生模型能够匹敌甚至超越其微调教师的性能。
引用
@article{arxiv.2601.10114,
title = {Following the Teacher's Footsteps: Scheduled Checkpoint Distillation for Domain-Specific LLMs},
author = {Cheng Feng and Chaoliang Zhong and Jun Sun and Yusuke Oishi},
journal= {arXiv preprint arXiv:2601.10114},
year = {2026}
}
备注
15 pages, submitted to ICPR 2026