中文

理论 Transformer 增强分段混合专家框架中的效率增益最优标度规律

机器学习 2025-03-27 v1 人工智能

摘要

本文引入了一个用于提高计算效率同时保持模型可扩展性的理论框架,基于 Transformer 增强的分段混合专家 (MoE) 架构。不同于传统 MoE 模型将整个词嵌送路由到选中专家,我们的方法将词嵌送维度本身进行分割——将每个 token 表示的片段分配给专门的专家。为抵消因词嵌表示损失带来的影响,我们利用预专家转换层重新计算跨 token 的注意力,从而降低序列长度维度。我们通过推导非线性关系的标度规律,将专家数量与模型维度、序列长度及系统开销等因素之间的关系形式化,其中包括闭式解和数值可求解表达式,用于在给定架构和硬件约束下识别最优专家数量。结果表明,本框架不仅为在不同框架下计算效率提供了理论边界,也为有效扩展大规模模型提供了实际设计指导。虽然经验验证仍在进行中,但我们提供了一套完整的实验路线图来评估该框架在效率、可扩展性和实用性方面的表现。

关键词

引用

@article{arxiv.2503.20750,
  title  = {Optimal Scaling Laws for Efficiency Gains in a Theoretical Transformer-Augmented Sectional MoE Framework},
  author = {Soham Sane},
  journal= {arXiv preprint arXiv:2503.20750},
  year   = {2025}
}