中文

用于零样本权重迁移的平均场 Ansatz

机器学习 2024-08-19 v1 数值分析 数值分析 概率论

摘要

大型语言模型(LLM)的预训练成本高昂。降低该成本的前沿方法之一是零样本权重迁移,在某些情况下也称为模型增长,可神奇地将小模型中训练的权重迁移到大模型。然而,权重迁移背后仍存在一些理论谜团。本文受平均场理论在神经网络动力学中先前应用的启发,引入平均场 Ansatz 为权重迁移提供理论解释。具体而言,我们提出行列(RC)Ansatz,从平均场视角描述神经网络中权重的测度结构,并允许闭合测度动力学。因此,在适当假设下,不同规模的神经网络承认共同分布,权重迁移方法可被视为采样方法。我们通过探索简单 MLP 示例以及 GPT-3 和 Llama-3.1 等 LLM 对 RC Ansatz 进行了经验验证。结果表明,在合适假设下平均场视角是充分的,可为零样本权重迁移提供理论支持。

关键词

引用

@article{arxiv.2408.08681,
  title  = {A Mean Field Ansatz for Zero-Shot Weight Transfer},
  author = {Xingyuan Chen and Wenwei Kuang and Lei Deng and Wei Han and Bo Bai and Goncalo dos Reis},
  journal= {arXiv preprint arXiv:2408.08681},
  year   = {2024}
}

备注

40 pages, 6 Figures, 1 table