中文

具有聚类注意力的快速Transformer

机器学习 2020-10-01 v2 机器学习

摘要

Transformer已被证明是序列建模中多种任务的成功模型。然而,作为其关键组件的注意力矩阵计算相对于序列长度具有二次复杂度,从而使其在长序列上成本高昂而难以承受。为此,我们提出聚类注意力(clustered attention),其不是为每个查询计算注意力,而是将查询分组为簇并仅对质心计算注意力。为了进一步改进这一近似,我们利用计算得到的簇来识别每个查询具有最高注意力的键,并计算精确的键/查询点积。这导致模型在簇数固定时相对于序列长度具有线性复杂度。我们在两个自动语音识别数据集上评估了我们的方法,并表明我们的模型在给定计算预算下始终优于原始Transformer。最后,我们通过在GLUE和SQuAD基准上以仅25个簇且无性能损失来近似预训练的BERT模型,证明我们的模型能以最少数量的簇近似任意复杂的注意力分布。

关键词

引用

@article{arxiv.2007.04825,
  title  = {Fast Transformers with Clustered Attention},
  author = {Apoorv Vyas and Angelos Katharopoulos and François Fleuret},
  journal= {arXiv preprint arXiv:2007.04825},
  year   = {2020}
}