中文

SPARTAN:面向参数高效 Transformer 的稀疏层级记忆

计算与语言 2022-12-01 v1 人工智能 机器学习

摘要

微调预训练语言模型(PLM)在一系列下游任务上取得了令人瞩目的性能,其模型规模也因此日益增大。由于每个任务都需要一份不同的模型副本,这种范式对于手机等存储受限的边缘设备而言是不可行的。本文提出 SPARTAN,一种面向边缘设备的参数高效(PE)且计算快速的架构,它在每个 Transformer 层之后添加了分层组织的稀疏记忆。SPARTAN 冻结 PLM 参数,仅微调其记忆,从而通过在不同任务间复用 PLM 主干网络显著降低存储开销。SPARTAN 包含两级记忆,在第一级中每个输入仅选择稀疏的父节点子集,并使用与这些父节点对应的子单元来计算输出表示。这种稀疏性结合其他架构优化,使得在 Raspberry Pi 4 上进行推理时,SPARTAN 的吞吐量比 PE 基线(adapters)高出 90% 以上,同时在 GLUE 基准上还超出后者 0.1 个百分点。此外,在少样本设置下其训练速度提升 34%,性能与 adapters 相差不超过 0.9 个百分点。定性分析表明,SPARTAN 中不同的父单元专门处理不同的主题,从而高效地实现了职责分工。

关键词

引用

@article{arxiv.2211.16634,
  title  = {SPARTAN: Sparse Hierarchical Memory for Parameter-Efficient Transformers},
  author = {Ameet Deshpande and Md Arafat Sultan and Anthony Ferritto and Ashwin Kalyan and Karthik Narasimhan and Avirup Sil},
  journal= {arXiv preprint arXiv:2211.16634},
  year   = {2022}
}