中文

PoNet:用于长序列中高效词元混合的池化网络

计算与语言 2023-05-23 v4 人工智能 机器学习

摘要

基于Transformer的模型已在各种NLP、视觉和语音任务中取得巨大成功。然而,Transformer的核心——自注意力机制——关于序列长度具有二次时间和内存复杂度,这阻碍了基于Transformer的模型在长序列上的应用。已有许多方法被提出以缓解该问题,例如稀疏注意力机制、低秩矩阵近似和可扩展核,以及替代自注意力的词元混合方法。我们提出了一种新颖的池化网络(PoNet)用于长序列中具线性复杂度的词元混合。我们设计了多粒度池化和池化融合,以捕获不同层次的上下文信息并组合其与词元的交互。在Long Range Arena基准上,PoNet显著优于Transformer并取得了有竞争力的准确率,同时在GPU上测得的所有序列长度中仅比最快的模型FNet稍慢。我们还对PoNet的迁移学习能力进行了系统研究,观察到PoNet在GLUE基准上达到了BERT准确率的95.7%,相对优于FNet 4.5%。全面的消融分析证明了所设计的多粒度池化和池化融合对长序列词元混合的有效性,以及所设计的预训练任务使PoNet学习可迁移上下文语言表示的功效。

关键词

引用

@article{arxiv.2110.02442,
  title  = {PoNet: Pooling Network for Efficient Token Mixing in Long Sequences},
  author = {Chao-Hong Tan and Qian Chen and Wen Wang and Qinglin Zhang and Siqi Zheng and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2110.02442},
  year   = {2023}
}

备注

Accepted by ICLR 2022. Codes and checkpoints are also available on huggingface hub: https://huggingface.co/chtan/ponet-base-uncased