中文

通过多线性算子复用预训练模型以实现高效训练

机器学习 2023-10-18 v1 人工智能

摘要

从头训练大型模型通常耗费大量资源。针对此问题,近期研究如bert2BERT和LiGO复用小型预训练模型来初始化大型模型(称为“目标模型”),显著加速了训练。尽管已有研究取得成功,它们仅通过映射部分权重来扩展预训练模型,忽略了整个模型间潜在的相关性。正如本文所示,预训练模型与目标模型的权重间存在内部与交叉相互作用。因此,部分映射可能无法捕获完整信息并导致不充分的扩展。本文提出一种方法,将目标模型的每个权重与预训练模型的所有权重线性关联,以进一步增强加速能力。我们利用多线性算子降低计算与空间复杂度,使资源需求可接受。实验表明,我们的方法在由DeiT-small迁移的DeiT-base上可节省76%的计算成本,分别优于bert2BERT +12.0%和LiGO +20.7%。

关键词

引用

@article{arxiv.2310.10699,
  title  = {Reusing Pretrained Models by Multi-linear Operators for Efficient Training},
  author = {Yu Pan and Ye Yuan and Yichun Yin and Zenglin Xu and Lifeng Shang and Xin Jiang and Qun Liu},
  journal= {arXiv preprint arXiv:2310.10699},
  year   = {2023}
}

备注

Accepted in NeurIPS 2023