中文

释放大语言模型中的涌现模块化

机器学习 2024-04-02 v2 人工智能

摘要

模块化神经网络(MNNs)相比整体式模型展现出多种优势。现有的 MNNs 通常是显式\textit{显式}的:其模块化架构被预先定义,各独立模块预期实现不同功能。近期工作揭示,标准预训练 transformer 中存在隐式\textit{隐式}模块化,即涌现模块化\textit{涌现模块化}。它们指出此类模块化结构在预训练早期阶段自发显现。尽管模块化具有诸多益处,大多数语言模型(LMs)在预训练与微调范式中仍被视为整体式模型,其涌现模块化被锁定且未充分利用。本文聚焦于释放 LMs 中的涌现模块化,展示了标准 LMs 可在不引入任何额外参数的情况下被微调为其 Mixture-of-Expert(MoE)对应版本。此类 MoE 源自涌现模块化,被称为 Emergent MoE(EMoE)。我们的实验表明,相比原始微调,微调 EMoE 能有效提升下游域内与域外泛化能力。我们的分析与消融研究进一步表明,该方法对多种配置具有鲁棒性,并可扩展至大语言模型(即 Llama2-7B 与 Llama-30B)。代码见 https://github.com/qiuzh20/EMoE。

关键词

引用

@article{arxiv.2310.10908,
  title  = {Unlocking Emergent Modularity in Large Language Models},
  author = {Zihan Qiu and Zeyu Huang and Jie Fu},
  journal= {arXiv preprint arXiv:2310.10908},
  year   = {2024}
}

备注

NAACL2024 Main Conference