双向模型规模迁移的统一框架
机器学习
2026-03-10 v1
摘要
将预训练知识从源模型迁移到不同架构大小的目标模型是灵活且高效模型规模化的关键挑战。然而,当前的参数空间方法将小到大 (S2L) 和大到小 (L2S) 规模缩放视为独立、不兼容的问题,分别关注参数合成和选择。这一碎片化视角导致出现专门工具,阻碍构建统一的双向框架。本文提出 BoT (Bidirectional knowledge Transfer),首个实现 S2L 和 L2S 规模统一的大小无关框架。我们的核心洞见是将模型权重视为连续信号,其中不同大小的模型代表可传输知识的不同离散化。这一多分辨率视角直接将 S2L 和 L2S 规模缩放表述为信号处理中的上采样和下采样操作,自然促成了离散小波变换 (DWT) 及其逆变换 (IDWT) 的采纳。BoT 利用小波的递归特性,将分解层级用作动态规模因子,以参数自由且计算高效的方式桥接不同模型大小。广泛实验表明,在 DeiT、BERT 和 GPT 上的实验显示,实现了最高达 67.1% 的 S2L 预训练 FLOPs 节省、52.8% 的 L2S 节省,并在 GLUE 和 SQuAD 等基准上取得最先进的性能。
引用
@article{arxiv.2603.07506,
title = {A Unified Framework for Knowledge Transfer in Bidirectional Model Scaling},
author = {Jianlu Shen and Fu Feng and Jiaze Xu and Yucheng Xie and Jiaqi Lv and Xin Geng},
journal= {arXiv preprint arXiv:2603.07506},
year = {2026}
}