面向Transformer架构的可组合保函数扩展
机器学习
2023-08-14 v1
摘要
训练最先进的神经网络在计算和时间上代价高昂。模型规模被公认为达到并改进最先进水平的关键因素。增大神经网络规模通常需要从随机初始化所有模型参数重新开始,因为这涉及架构参数的改变,无法将知识从小规模模型直接迁移。在这项工作中,我们提出六种可组合变换,以在保持功能的前提下逐步增大基于Transformer的神经网络的规模,从而按需扩展模型容量。我们给出了在最小初始化约束下每种变换的精确保函数证明。所提方法可通过在训练过程中逐步扩展架构,实现针对更大更强模型的高效训练流程。
引用
@article{arxiv.2308.06103,
title = {Composable Function-preserving Expansions for Transformer Architectures},
author = {Andrea Gesmundo and Kaitlin Maile},
journal= {arXiv preprint arXiv:2308.06103},
year = {2023}
}