Gradient Transformer:学习为大语言模型生成更新
机器学习
2026-05-28 v1
摘要
许多组织缺乏在私有数据上微调大语言模型(LLM)以提升实用性的计算资源,而仅微调小型语言模型(TinyLM)表现不佳。为此,我们提出一种无数据知识蒸馏框架,基于在私有数据上微调的TinyLM生成LLM的更新向量。更新向量是指从初始模型到其在数据集上微调版本的参数变化向量,捕捉微调期间累积梯度步骤的效果。我们框架的核心思想是一种新的Gradient Transformer,其将TinyLM的更新向量转换为LLM的更新向量。基于阴影数据集推导得出,Grad-Transformer捕捉了TinyLM和LLM更新向量之间的相关性,使第三方提供商在获取组织的TinyLM更新向量而无需接触组织的私有数据的情况下,生成LLM的更新向量。该框架支持多组织协作以联合更新LLM,提高性能和成本效益。广泛的实验在语言建模和推理任务上表明,Grad-Transformer在严格差分隐私保护下,显著优于最新的知识蒸馏基线。
引用
@article{arxiv.2605.27591,
title = {Gradient Transformer: Learning to Generate Updates for LLMs},
author = {Binh-Nguyen Nguyen and Khang Tran and NhatHai Phan and Issa Khalil},
journal= {arXiv preprint arXiv:2605.27591},
year = {2026}
}
备注
Accepted at ICML 2026