Tri-Attention:面向自然语言处理的显式上下文感知注意力机制
计算与语言
2022-11-08 v1 人工智能
摘要
在自然语言处理(NLP)中,词或句子的上下文起着至关重要的作用。段落的语义表示或历史对话等上下文信息构成了对话的重要组成部分,也是对当前短语或句子进行准确理解的关键。然而,尽管标准注意力机制在建模序列对齐方面取得了巨大成功,它们通常仅利用查询(query)和键(key)生成权重而忽略上下文,形成了一种双注意力(Bi-Attention)框架。这种双注意力机制并未显式建模目标序列的上下文、查询和键之间的交互,遗漏了重要的上下文信息,导致注意力性能不佳。为此,本文提出一种新颖且通用的三重注意力(Tri-Attention)框架,将标准双注意力机制进行扩展,在计算相关性分数时将上下文作为第三维引入,显式地交互查询、键与上下文。通过将双注意力中基于二维向量的加性、点积、缩放点积和双线性操作扩展为三重注意力的张量操作,生成了四种 Tri-Attention 变体。在三个 NLP 任务上的大量实验表明,Tri-Attention 优于约 30 种最先进的非注意力方法、标准双注意力方法、上下文双注意力方法以及预训练神经语言模型。
引用
@article{arxiv.2211.02899,
title = {Tri-Attention: Explicit Context-Aware Attention Mechanism for Natural Language Processing},
author = {Rui Yu and Yifeng Li and Wenpeng Lu and Longbing Cao},
journal= {arXiv preprint arXiv:2211.02899},
year = {2022}
}