近似两层前馈网络以实现高效 Transformer
机器学习
2023-11-22 v3 神经与进化计算
摘要
如何在不牺牲性能的前提下降低神经网络(NNs)的计算与内存需求?许多近期工作使用稀疏专家混合(MoEs)来构建资源高效的大语言模型(LMs)。本文引入若干关于 MoEs 的新视角,提出一个统一多种近似两层 NNs(例如 Transformer 的前馈块)方法的通用框架,包括乘积键记忆(PKMs)。借助该框架的洞见,我们提出改进 MoEs 与 PKMs 的方法。与先前在等量计算条件下将 MoEs 与稠密基线比较的工作不同,我们的评估条件是等量参数,这对合理评估 LMs 至关重要。我们表明,在两个不同规模下,我们的 MoEs 在 WikiText-103 与 enwiki8 数据集上与稠密 Transformer-XL 具有竞争力,同时资源效率更高。这表明 MoEs 不仅与极大规模 LMs 相关,也与任意规模的资源高效 LMs 相关。我们的代码已公开。
引用
@article{arxiv.2310.10837,
title = {Approximating Two-Layer Feedforward Networks for Efficient Transformers},
author = {Róbert Csordás and Kazuki Irie and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2310.10837},
year = {2023}
}
备注
Accepted to EMNLP 2023 Findings