Transformer 的广义注意力机制与相对位置
计算与语言
2022-08-23 v1 机器学习
摘要
本文中,我们首先对 Vaswani 等人的自注意力机制提出新的解释,进而提出广义注意力机制(GAM)。遵循该解释,我们给出构成 GAM 的多种注意力机制变体的描述。此外,我们在 GAM 框架内提出一种新的相对位置表征。该表征可轻易用于如下情形:输入序列中彼此相邻的元素在实际数据集/语料中可处于随机位置。
引用
@article{arxiv.2208.10247,
title = {Generalized Attention Mechanism and Relative Position for Transformer},
author = {R. V. R. Pandya},
journal= {arXiv preprint arXiv:2208.10247},
year = {2022}
}
备注
6 pages