DataMUX:用于神经网络的输入复用技术
机器学习
2022-11-15 v2 人工智能
摘要
在本文中,我们提出数据复用(DataMUX),一种使深度神经网络能够使用单一紧凑表示同时处理多个输入的技术。DataMUX 表明神经网络能够对输入混合体生成准确预测,从而以极小的额外内存需求实现吞吐量的提升。我们的方法使用两个关键组件——1)复用层,在对每个输入执行固定的线性变换后将其组合,创建与单个输入大小相同的混合表示,再由基网络处理;2)解复用层,在为每个输入生成预测之前,将基网络的输出转换回独立表示。我们展示了 DataMUX 在不同架构(Transformer,以及在较小程度上的 MLP 和 CNN)上的可行性,涵盖句子分类、命名实体识别和图像分类等六项不同任务。例如,用于 Transformer 的 DataMUX 可复用多达 x/x 输入,在 MNLI(一个自然语言推理任务)上分别以绝对性能下降 和 的极小代价实现吞吐量 x/x 的提升。我们还给出了自注意力网络中复用的理论构造,并分析了 DataMUX 中各种设计要素的影响。
引用
@article{arxiv.2202.09318,
title = {DataMUX: Data Multiplexing for Neural Networks},
author = {Vishvak Murahari and Carlos E. Jimenez and Runzhe Yang and Karthik Narasimhan},
journal= {arXiv preprint arXiv:2202.09318},
year = {2022}
}
备注
NeurIPS 2022