中文

用于紧凑型多头自注意力的低秩分解

计算与语言 2020-08-11 v2 机器学习

摘要

从文本中学习有效表示一直是自然语言处理(NLP)与文本挖掘领域的活跃研究方向。注意力机制处于学习上下文句子表示的前沿。当前许多NLP任务的最先进方法使用BERT、XLNet等大型预训练语言模型来学习表示。这些模型基于Transformer架构,该架构包含由多头自注意力与前馈网络组成的循环计算块。Transformer模型计算复杂度的主要瓶颈之一是自注意力层,它既计算昂贵又参数密集。在本工作中,我们提出了一种在GRU上运行的新型多头自注意力机制,该机制被证明比Transformer中提出的用于文本分类任务的自注意力机制计算更廉价且参数更高效。我们方法的效率主要源于两项优化:1)我们对亲和矩阵使用低秩矩阵分解,以高效地获得多种注意力分布,而非为每个头设置独立参数;2)注意力分数通过查询全局上下文向量获得,而非密集查询句子中的所有词。我们在电影评论情感分析、根据评论预测商业评分以及将新闻文章分类到主题等任务上评估了所提模型的性能。我们发现所提方法匹配或超越了一系列强基线,并且比可比的多头方法参数更高效。我们还进行了定性分析,以验证所提方法具有可解释性并能捕捉上下文相关的词重要性。

关键词

引用

@article{arxiv.1912.00835,
  title  = {Low Rank Factorization for Compact Multi-Head Self-Attention},
  author = {Sneha Mehta and Huzefa Rangwala and Naren Ramakrishnan},
  journal= {arXiv preprint arXiv:1912.00835},
  year   = {2020}
}

备注

9 pages, 5 figures