中文

面向高效序列建模的稀疏模块化激活

机器学习 2023-11-07 v4 计算与语言

摘要

近期将线性状态空间模型(SSMs)与自注意力机制相结合的混合模型,在一系列序列建模任务上展现出令人印象深刻的成果。然而,现有方法静态且均匀地对输入序列中所有元素施加注意力模块,导致次优的质量-效率权衡。为克服该局限,我们引入稀疏模块化激活(SMA),一种使神经网络以可微分方式对序列元素稀疏且动态地激活子模块的通用机制。通过允许各元素跳过未激活的子模块,SMA在训练与推理阶段均降低了神经网络的计算与内存消耗。为验证SMA在序列建模上的有效性,我们设计了一种新颖神经架构SeqBoat,其利用SMA基于从SSM学到的状态表示稀疏激活门控注意力单元(GAU)。通过将GAU约束为仅对激活输入进行局部注意力,SeqBoat可实现线性推理复杂度与理论无限注意力跨度,并提供比基于分块模型更优的质量-效率权衡。通过在长序列建模、语音分类与语言建模等广泛任务上的实验,SeqBoat在具有线性复杂度的混合模型中取得新的最优结果,并通过学到的稀疏激活模式揭示了各任务所需的注意力数量。我们的代码公开于 https://github.com/renll/SeqBoat。

关键词

引用

@article{arxiv.2306.11197,
  title  = {Sparse Modular Activation for Efficient Sequence Modeling},
  author = {Liliang Ren and Yang Liu and Shuohang Wang and Yichong Xu and Chenguang Zhu and ChengXiang Zhai},
  journal= {arXiv preprint arXiv:2306.11197},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023. Camera-ready Version