中文

LEMON:无损模型扩展

机器学习 2023-10-13 v1 机器学习

摘要

深度神经网络尤其是Transformers的规模化对其性能飙升至关重要,并进一步催生了基础模型中复杂的推理能力。此类扩展通常需从随机初始化从头训练大模型,未能利用已由较小模型习得的知识,而较小模型的获取本身已耗费大量资源。为应对这一低效问题,我们提出L\textbf{L}osslE\textbf{E}ss MO\textbf{MO}del ExpansioN\textbf{N}(LEMON),一种利用较小但预训练对应模型的权重来初始化扩展模型的方案。随后使用专为扩展模型定制的优化学习率调度器进行模型训练,与从头训练相比大幅缩短训练时间。值得注意的是,LEMON具有通用性,确保与各类网络结构兼容,包括Vision Transformers和BERT等模型。我们的实证结果表明,与从头训练相比,LEMON为Vision Transformers降低56.7%计算成本,为BERT降低33.2%。

关键词

引用

@article{arxiv.2310.07999,
  title  = {LEMON: Lossless model expansion},
  author = {Yite Wang and Jiahao Su and Hanlin Lu and Cong Xie and Tianyi Liu and Jianbo Yuan and Haibin Lin and Ruoyu Sun and Hongxia Yang},
  journal= {arXiv preprint arXiv:2310.07999},
  year   = {2023}
}

备注

Preprint