中文

面向Transformer的查询-键归一化

计算与语言 2020-10-12 v1 人工智能 机器学习

摘要

低资源语言翻译是一项具有挑战性但具社会价值的NLP任务。基于近期将Transformer归一化适配于该设置的工作,我们提出QKNorm,一种修改注意力机制使softmax函数不易发生任意饱和且不损失表达力的归一化技术。具体而言,我们在将每个查询与键矩阵沿头维度相乘前施加ℓ_2归一化,随后通过可学习参数放大而非除以嵌入维度的平方根。我们在来自TED Talks语料库与IWSLT'15的5个低资源翻译对上,相较最先进双语基准平均提升0.928 BLEU。

关键词

引用

@article{arxiv.2010.04245,
  title  = {Query-Key Normalization for Transformers},
  author = {Alex Henry and Prudhvi Raj Dachapally and Shubham Pawar and Yuxuan Chen},
  journal= {arXiv preprint arXiv:2010.04245},
  year   = {2020}
}

备注

8 pages, 2 figures, accepted at Findings of EMNLP 2020