中文

用于长文本建模的循环注意力网络

计算与语言 2023-06-13 v1

摘要

基于自注意力的模型在短文本挖掘中取得了显著进展。然而,二次计算复杂度限制了它们在长文本处理中的应用。先前工作采用分块策略将长文档划分为块,并将自注意力主干与循环结构堆叠以提取语义表示。这种方法使注意力机制无法并行化,显著增加了训练成本并提高了硬件要求。重新审视自注意力机制与循环结构,本文提出一种新颖的长文档编码模型——循环注意力网络(RAN),以实现自注意力的循环操作。结合双方优势,精心设计的 RAN 能够提取词级与文档级表示中的全局语义,使其天然兼容序列与分类任务。此外,RAN 在计算上可扩展,因其支持长文档处理的并行化。大量实验证明了所提 RAN 模型在分类与序列任务上的长文本编码能力,展现出其广泛应用的潜力。

关键词

引用

@article{arxiv.2306.06843,
  title  = {Recurrent Attention Networks for Long-text Modeling},
  author = {Xianming Li and Zongxi Li and Xiaotian Luo and Haoran Xie and Xing Lee and Yingbin Zhao and Fu Lee Wang and Qing Li},
  journal= {arXiv preprint arXiv:2306.06843},
  year   = {2023}
}