中文

MoEUT:混合专家通用 Transformer

机器学习 2024-10-15 v2 人工智能 神经与进化计算

摘要

先前的通用 Transformer(UTs)工作已显示参数在层次上的共享的重要性。通过允许深度上的递归,UTs 在学习组合推断方面优于标准 Transformer,但层共享带来了参数-计算比率的实际限制:它大幅降低了与相同维度的非共享模型相比的参数数量。 naively scaling up the layer size to compensate for the loss of parameters makes its computational resource requirements prohibitive。实际中,尚无任何前期工作成功提出了一种在参数数量受主导的任务(如语言建模)中具有竞争力的共享层 Transformer 设计。本文提出了 MoEUT(发音为 "moot"),一种有效的混合专家(MoE)基于共享层的 Transformer 架构,将最新的 MoE 进展用于标准 Transformer 的 feedforward 和 attention 层,同时与 UTs 特定且关键的层规范化和分组方案相结合。 resulting UT model, for the first time, slightly outperforms standard Transformers on language modeling tasks such as BLiMP and PIQA, while using significantly less compute and memory。

关键词

引用

@article{arxiv.2405.16039,
  title  = {MoEUT: Mixture-of-Experts Universal Transformers},
  author = {Róbert Csordás and Kazuki Irie and Jürgen Schmidhuber and Christopher Potts and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2405.16039},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024