百万专家混合模型
机器学习
2024-07-08 v1 人工智能
摘要
标准变换器架构中的前馈(FFW)层在隐藏层宽度增大时导致计算成本和激活内存呈线性增长。稀疏混合专家(MoE)架构已成为一种可行方法,通过解耦模型规模和计算成本来解决此问题。近期发现的细粒度MoE比例规律表明,更高的细粒度度导致更佳性能。然而,现有MoE模型受限于小规模专家数量,受计算和优化挑战制约。本文引入 PEER(参数高效专家检索),一种新型层设计,利用乘积关键技术从庞大的微型专家池(超过百万个)中进行稀疏检索。在语言建模任务上的实验表明,PEER层在性能-计算权衡方面优于稠密FFW和粗粒度MoE。通过实现对大量专家的高效利用,PEER unlocks 了在保持计算效率的同时进一步扩展变换器模型的潜力。
引用
@article{arxiv.2407.04153,
title = {Mixture of A Million Experts},
author = {Xu Owen He},
journal= {arXiv preprint arXiv:2407.04153},
year = {2024}
}