迈向参数高效:具有动态容量的分层稀疏激活 Transformer
计算与语言
2023-10-24 v2
摘要
采用稀疏激活的专家混合(MoE)模型已证明能在保持每 token 低计算需求的同时显著增加参数数量。然而,近期研究指出 MoE 模型天生参数低效,因为性能提升随专家数量增加而递减。我们假设这种参数低效源于所有专家具有相等容量,这可能无法充分满足不同 token 或任务的复杂程度需求。有鉴于此,我们提出分层专家混合(SMoE)模型,其具有分层结构并能为不同 token 分配动态容量。我们在三个多语言机器翻译基准(分别包含 4、15 和 94 个语言对)上证明了 SMoE 的有效性。我们表明 SMoE 以相同或更少参数优于多个最先进的 MoE 模型。
引用
@article{arxiv.2305.02176,
title = {Towards Being Parameter-Efficient: A Stratified Sparsely Activated Transformer with Dynamic Capacity},
author = {Haoran Xu and Maha Elbayad and Kenton Murray and Jean Maillard and Vedanuj Goswami},
journal= {arXiv preprint arXiv:2305.02176},
year = {2023}
}
备注
Accepted at Findings of EMNLP 2023