中文

Lory:面向自回归语言模型预训练的全可微混合专家

计算与语言 2024-08-20 v2 机器学习

摘要

混合专家(MoE)模型促进了规模化,但训练路由网络带来了优化非可微、离散目标的挑战。最近提出了一种全可微 MoE 架构SMEAR (Muqeeth 等,2023),但其有效性仅在分类任务的下游微调中得到验证。本文提出 Lory,首个将此类架构扩展至自回归语言模型预训练的方法。Lory 引入了两个关键技术:(1) 因果分段路由策略,实现高效的专家合并操作,同时保持语言模型的自回归性;(2) 基于相似性的数据批处理方法,通过在训练实例中对相似文档进行分组来鼓励专家专业化。我们在从零开始在 1500 亿个标记上预训练了一系列 Lory 模型,最多可达 32 个专家和 300 亿参数(15 亿活跃参数)。实验结果表明,Lory 在困惑度提升 13.9%,以及各种下游任务中表现出 1.5%-11.1% 的显著性能提升。尽管采用分段级路由,Lory 模型仍在与采用 token 级路由的领先 MoE 模型中实现了具竞争力的性能。我们进一步表明,训练得到的 Lory 专家在无监督条件下捕获了领域级专业化。我们的工作凸显了全可微 MoE 架构在语言模型预训练中的潜力,主张该领域的未来研究。

关键词

引用

@article{arxiv.2405.03133,
  title  = {Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training},
  author = {Zexuan Zhong and Mengzhou Xia and Danqi Chen and Mike Lewis},
  journal= {arXiv preprint arXiv:2405.03133},
  year   = {2024}
}

备注

COLM 2024