中文

DYAD:一种描述性但回避密集的线性神经网络层高效近似方法

机器学习 2023-12-13 v1 计算与语言

摘要

我们设计、实现并评估了DYAD层,它可以作为线性层(PyTorch中的nn.Linear())更快、更节省内存的近似替代。这些层出现在常见子组件中,例如Transformer的ff模块。DYAD基于一种定制的近稀疏矩阵结构,该结构近似于典型实现中与输入进行矩阵乘法的密集“权重”矩阵W,即DENSE。我们的替代近稀疏矩阵结构可分解为两个矩阵之和,这两个矩阵可置换为块稀疏对应物。它们可以表示为3D张量,共同允许比DENSE更快地执行与小批量输入矩阵X的矩阵乘法(O(rows(W) x cols(W)) --> O(rows(W) x cols(W) / #blocks))。作为实验的核心,我们预训练了两种规模的OPT架构和一种规模的Pythia架构的DYAD和DENSE变体,包括在babyLM基准的不同token规模下。我们发现DYAD在零样本(如BLIMP)、少样本(OPENLM)和微调(GLUE)基准上具有竞争力(>= DENSE性能的90%),同时在GPU上训练速度至少快7-15%(即使在125m规模),并且在更大规模和模型宽度下显示出更大的加速。

关键词

引用

@article{arxiv.2312.06881,
  title  = {DYAD: A Descriptive Yet Abjuring Density efficient approximation to linear neural network layers},
  author = {Sarin Chandy and Varun Gangal and Yi Yang and Gabriel Maggiotti},
  journal= {arXiv preprint arXiv:2312.06881},
  year   = {2023}
}

备注

Accepted at WANT workshop at NeurIPS 2023; code at https://github.com/asappresearch/dyad