中文

是什么让卷积模型在长序列建模上表现出色?

机器学习 2022-10-18 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

卷积模型已被广泛应用于多个领域。然而,大多数现有模型仅使用局部卷积,使模型无法高效处理长程依赖。注意力通过聚合全局信息克服了该问题,但也使计算复杂度相对于序列长度呈二次方增长。最近,Gu等人[2021]提出了一种受状态空间模型启发的称为S4的模型。S4可高效实现为核大小等于输入序列长度的全局卷积模型。S4能建模比Transformers长得多的序列,并在多项长程任务上取得优于SOTA的显著增益。尽管取得经验成功,S4仍较复杂,它需要精细的参数化与初始化方案。因此,S4不够直观且难以使用。此处我们旨在揭开S4的神秘面纱,提取促成S4作为全局卷积模型成功的基本原理。我们聚焦于卷积核的结构,并识别出S4所具有的两条关键但直观的原理,它们足以构成一个有效的全局卷积模型:1) 卷积核的参数化需高效,即参数数量应随序列长度亚线性增长。2) 核需满足衰减结构,即与较近邻卷积的权重应大于与较远邻的权重。基于这两条原理,我们提出一种简单却有效的卷积模型,称为结构化全局卷积(SGConv)。SGConv在多项任务上展现出强劲经验性能:1) 以更快速度,SGConv在Long Range Arena与Speech Command数据集上超越S4。2) 将SGConv插入标准语言与视觉模型时,它显示出提升效率与性能的潜力。

关键词

引用

@article{arxiv.2210.09298,
  title  = {What Makes Convolutional Models Great on Long Sequence Modeling?},
  author = {Yuhong Li and Tianle Cai and Yi Zhang and Deming Chen and Debadeepta Dey},
  journal= {arXiv preprint arXiv:2210.09298},
  year   = {2022}
}

备注

The code is available at https://github.com/ctlllll/SGConv