中文

Fovea Transformer:基于结构化细到粗注意力的高效长上下文建模

计算与语言 2024-01-12 v2

摘要

Transformer 中自注意力的二次复杂度阻碍了长文本的处理。为缓解该问题,已有工作利用 token 的关键信息可从其邻域获得这一观察,提出对注意力矩阵进行稀疏化。这些方法通常将某种形式的局部注意力与全局注意力相结合。此类组合在从局部到全局时引入了上下文粒度的突变,这可能并不理想。我们认为更平滑的过渡有可能增强模型捕捉长上下文依赖的能力。在本研究中,我们提出 Fovea Transformer,一种聚焦于长上下文的 transformer,旨在应对捕捉全局依赖的同时保持计算效率的挑战。为此,我们从输入序列构建多尺度树,并随着上下文 token 到查询 token 的距离增大,在树中使用粒度逐渐变粗的上下文 token 表示。我们在三个长上下文摘要任务上评估了我们的模型\footnote{我们的代码公开于:\textit{https://github.com/ZiweiHe/Fovea-Transformer}}。它在其中两个任务上取得了最先进的性能,在第三个任务上取得了具有竞争力的结果,评估指标有混合的提升与退步。

关键词

引用

@article{arxiv.2311.07102,
  title  = {Fovea Transformer: Efficient Long-Context Modeling with Structured Fine-to-Coarse Attention},
  author = {Ziwei He and Jian Yuan and Le Zhou and Jingwen Leng and Bo Jiang},
  journal= {arXiv preprint arXiv:2311.07102},
  year   = {2024}
}