释放大语言模型中的涌现模块化
机器学习
2024-04-02 v2 人工智能
摘要
模块化神经网络(MNNs)相比整体式模型展现出多种优势。现有的 MNNs 通常是的:其模块化架构被预先定义,各独立模块预期实现不同功能。近期工作揭示,标准预训练 transformer 中存在模块化,即。它们指出此类模块化结构在预训练早期阶段自发显现。尽管模块化具有诸多益处,大多数语言模型(LMs)在预训练与微调范式中仍被视为整体式模型,其涌现模块化被锁定且未充分利用。本文聚焦于释放 LMs 中的涌现模块化,展示了标准 LMs 可在不引入任何额外参数的情况下被微调为其 Mixture-of-Expert(MoE)对应版本。此类 MoE 源自涌现模块化,被称为 Emergent MoE(EMoE)。我们的实验表明,相比原始微调,微调 EMoE 能有效提升下游域内与域外泛化能力。我们的分析与消融研究进一步表明,该方法对多种配置具有鲁棒性,并可扩展至大语言模型(即 Llama2-7B 与 Llama-30B)。代码见 https://github.com/qiuzh20/EMoE。
引用
@article{arxiv.2310.10908,
title = {Unlocking Emergent Modularity in Large Language Models},
author = {Zihan Qiu and Zeyu Huang and Jie Fu},
journal= {arXiv preprint arXiv:2310.10908},
year = {2024}
}
备注
NAACL2024 Main Conference