中文

可变大小模型自适应初始化的权重模板:WAVE

机器学习 2025-03-18 v3

摘要

模型参数的日益复杂凸显了预训练模型的重要性。然而,部署约束常常需要不同大小的模型,暴露了传统预训练和微调范式的局限性,尤其是在目标模型大小与预训练模型不兼容时。为解决这一挑战,我们提出了 WAVE,这是一种将可变大小模型初始化从多任务视角重新表述的方法,其中将初始化每个模型大小视为一个独立任务。WAVE 采用共享的、大小无关的权重模板,以及大小特定的权重缩放器,以实现不同模型大小之间的一致初始化。这些权重模板构建于 Learngene 框架中,通过受 Kronecker 规则约束的蒸馏过程整合来自预训练模型的知识。目标模型随后通过拼接和加权这些模板进行初始化,通过轻量级权重缩放器建立自适应连接规则,其参数从最小训练数据中学习。广泛的实验表明,WAVE 在初始化各种深度和宽度的模型方面实现了最先进的性能。权重模板中封装的知识也是任务无关的,可以 seamless 地跨越 diverse 下游数据集进行迁移。代码将在 https://github.com/fu-feng/WAVE 上公开。

关键词

引用

@article{arxiv.2406.17503,
  title  = {WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models},
  author = {Fu Feng and Yucheng Xie and Jing Wang and Xin Geng},
  journal= {arXiv preprint arXiv:2406.17503},
  year   = {2025}
}