在资源受限且不共享模型的情况下联合生长Transformer
人工智能
2024-06-21 v1
摘要
大规模模型的高资源消耗阻碍了资源受限的用户开发他们定制的Transformer。为此,本文考虑一个名为Fed-Grow的联邦框架,用于多个参与者从其预训练的小模型合作扩展出一个Transformer。在Fed-Grow下,设计了一种Dual-LiGO(双线性增长算子)架构,以帮助参与者将其预训练的小模型扩展为Transformer。在Dual-LiGO中,Local-LiGO部分用于解决由各种预训练模型引起的异质性问题,而Global-LiGO部分被共享以交换来自预训练模型、本地数据和参与者训练过程的隐式知识。与模型共享不同,仅共享Global-LiGO增强了我们方法的隐私性。与几种最先进的模拟方法相比,我们的方法在计算和通信方面具有更高的准确率、更好的精度和更低的资源消耗。据我们所知,以前的模型扩展工作大多是集中式的,而我们的工作是第一个从多个预训练异构模型合作生长Transformer,并在本地数据和模型方面保护用户隐私的工作。我们希望我们的方法能够将Transformer扩展到广泛的分布式场景,并鼓励更多资源受限的用户享受大规模Transformer带来的红利。
引用
@article{arxiv.2406.13450,
title = {Federating to Grow Transformers with Constrained Resources without Model Sharing},
author = {Shikun Shen and Yifei Zou and Yuan Yuan and Yanwei Zheng and Peng Li and Xiuzhen Cheng and Dongxiao Yu},
journal= {arXiv preprint arXiv:2406.13450},
year = {2024}
}