中文

基于Transformer的语言表示模型中注意力的可视化

人机交互 2019-06-12 v2 机器学习 机器学习

摘要

我们提出了一个开源工具,用于可视化基于Transformer的语言表示模型中的多头自注意力。该工具通过以三种粒度可视化注意力扩展了早期工作:注意力头级别、模型级别和神经元级别。我们描述了这些视图如何帮助解释模型,并在BERT模型和OpenAI GPT-2模型上演示了该工具。我们还提出了分析GPT-2的三个用例:检测模型偏差、识别重复模式以及将神经元与模型行为相关联。

关键词

引用

@article{arxiv.1904.02679,
  title  = {Visualizing Attention in Transformer-Based Language Representation Models},
  author = {Jesse Vig},
  journal= {arXiv preprint arXiv:1904.02679},
  year   = {2019}
}