中文

可折叠超网:融合不同初始化和任务的 Transformer 的可扩展方法

机器学习 2025-08-18 v2

摘要

近期方法旨在将具有相同架构、在不同任务上训练的神经网络(NN)合并为单一的多任务模型。虽然大多数工作聚焦于从共享预训练网络初始化的NN合并这一较简单的设置,但我们关注的是从不同初始化在不同任务上训练的大规模Transformer的更具挑战性的问题。我们表明,传统的合并方法在此设置下会发生灾难性失败,而知识蒸馏(KD)取得了更好的结果,尽管成本更高。然而,KD数据效率低下,因为它未能利用原始模型的权重。为解决此问题,我们引入了“可折叠超网合并”(Foldable SuperNet Merge, FS-Merge),通过特征重建目标训练包含原始模型(带冻结权重)的超网。训练后,超网可折叠回单个原始模型的大小。FS-Merge简单高效,计算成本相当于KD,已证明在MLP模型上比传统合并方法具有更强的表达能力。在各种规模、任务、模态和分布转移的情况下,FS-Merge在MLP和Transformer上实现了最先进的效果,尤其在数据有限的场景下表现突出。

关键词

引用

@article{arxiv.2410.01483,
  title  = {Foldable SuperNets: Scalable Merging of Transformers with Different Initializations and Tasks},
  author = {Edan Kinderman and Itay Hubara and Haggai Maron and Daniel Soudry},
  journal= {arXiv preprint arXiv:2410.01483},
  year   = {2025}
}