低秩克隆(Low-Rank Clone):高效知识蒸馏方法
计算与语言
2025-12-19 v4 人工智能
摘要
训练高性能小型语言模型(SLMs)仍然昂贵,即使使用来自大型教师模型的知识蒸馏和剪枝。现有工作常面临三个关键挑战:(1)硬性剪枝导致信息损失,(2)表示表示间对齐不够高效,(3)未充分利用来自前馈网络(FFN)的有信息激活。为解决这些问题,我们引入Low-Rank Clone (LRC),一种高效的预训练方法,通过压缩教师权重实现软剪枝,通过对齐学生激活(包括FFN信号)与教师激活来实现激活克隆。这种统一设计最大化知识传输,同时消除对显式对齐模块的需求。针对开源教师(如Llama-3.2-3B-Instruct、Qwen2.5-3B/7B-Instruct)进行大量实验表明,LRC在仅使用20B token的情况下匹配或超越在数万亿token上训练的state-of-the-art模型,实现了超过1,000倍的训练效率。我们的代码和模型检查点分别提供于https://github.com/CURRENTF/LowRankClone 和 https://huggingface.co/collections/JitaiHao/low-rank-clone-lrc-6828389e96a93f1d4219dfaf。
引用
@article{arxiv.2505.12781,
title = {A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone},
author = {Jitai Hao and Qiang Huang and Hao Liu and Xinyan Xiao and Zhaochun Ren and Jun Yu},
journal= {arXiv preprint arXiv:2505.12781},
year = {2025}
}
备注
NeurIPS 2025 Spotlight