中文

Cluster-Former:基于聚类的稀疏 Transformer 用于长程依赖编码

计算与语言 2021-06-08 v2

摘要

Transformer 已成为深度学习领域中无处不在的模型。决定其成功的关键要素之一是自注意力机制,该机制允许对输入词元进行全连接的上下文编码。然而,尽管自注意力在建模短序列方面有效,但在处理具有极长程依赖的输入时表现不佳,因为其复杂度随序列长度呈二次增长。因此,长序列通常通过滑动窗口分块由 Transformer 编码。本文提出 Cluster-Former,一种新颖的基于聚类的稀疏 Transformer,用于在分块序列间执行注意力。所提出的框架以两种独特的 Transformer 层为核心:滑动窗口层(Sliding-Window Layer)与 Cluster-Former 层(Cluster-Former Layer),它们联合且迭代地编码局部序列信息与全局上下文。这一新设计允许局部窗口之外的信息整合,这对于依赖长程依赖的问答(QA)任务尤其有益。实验表明,Cluster-Former 在多个主要 QA 基准上取得了最先进的性能。

关键词

引用

@article{arxiv.2009.06097,
  title  = {Cluster-Former: Clustering-based Sparse Transformer for Long-Range Dependency Encoding},
  author = {Shuohang Wang and Luowei Zhou and Zhe Gan and Yen-Chun Chen and Yuwei Fang and Siqi Sun and Yu Cheng and Jingjing Liu},
  journal= {arXiv preprint arXiv:2009.06097},
  year   = {2021}
}

备注

ACL Findings 2021, 11 pages