中文

Transformer模型中注意力的多尺度可视化

人机交互 2019-06-14 v1 计算与语言 机器学习

摘要

Transformer是一种序列模型,它摒弃了传统的循环架构,转而采用完全基于注意力的方法。除了提升性能外,使用注意力的一个优势是它还能通过展示模型如何对不同输入元素分配权重来帮助解释模型。然而,Transformer模型中的多层、多头注意力机制可能难以解读。为使模型更易于理解,我们引入了一个开源工具,以多种尺度可视化注意力,每种尺度都提供对注意力机制的独特视角。我们在BERT和OpenAI GPT-2上演示了该工具,并给出了三个示例用例:检测模型偏差、定位相关注意力头,以及将神经元与模型行为相关联。

关键词

引用

@article{arxiv.1906.05714,
  title  = {A Multiscale Visualization of Attention in the Transformer Model},
  author = {Jesse Vig},
  journal= {arXiv preprint arXiv:1906.05714},
  year   = {2019}
}

备注

To appear in ACL 2019 (System Demonstrations). arXiv admin note: substantial text overlap with arXiv:1904.02679