中文

RCMHA:用于自然语言建模的相对卷积多头注意力

计算与语言 2023-08-08 v1 人工智能

摘要

注意力模块在自然语言建模中应用广泛,在自然语言处理这一更宽泛领域中呈现出独特的挑战。多头注意力(MHA)采用绝对位置编码,对词元长度施加了限制,并在处理嵌入输入时带来大量内存消耗。研究者当前提出的补救方案涉及使用相对位置编码,类似于 Transformer-XL 或相对多头注意力(RMHA)所采用的方法,尽管所采用的架构消耗可观的内存资源。为应对这些挑战,本研究致力于改进 MHA,将相对位置编码与深度可分离卷积层(Depth-Wise Convolutional Layer)架构相结合,有望在提高精度的同时最小化内存使用。所提出的 RCMHA 框架涉及对两个核心组件的修改:首先,对输入嵌入(涵盖 Query、Key 和 Value 参数)应用深度可分离卷积层;其次,将相对位置编码融入注意力打分阶段,并与缩放点积注意力(Scaled Dot-Product Attention)协调集成。实证实验凸显了 RCMHA 的优势,其展现出更优精度,得分为 0.572,优于 MHA、多深度卷积头注意力(MDHA)和 RMHA 等其它注意力模块。关于内存利用,RMHA 最为节省,平均消耗 2.98 GB,优于需 3.5 GB 的 RMHA。

关键词

引用

@article{arxiv.2308.03429,
  title  = {RCMHA: Relative Convolutional Multi-Head Attention for Natural Language Modelling},
  author = {Herman Sugiharto and Aradea and Husni Mubarok},
  journal= {arXiv preprint arXiv:2308.03429},
  year   = {2023}
}

备注

13 pages, 13 figures, 6 tables