基于Transformer的语言表示模型中注意力的可视化
人机交互
2019-06-12 v2 机器学习
机器学习
摘要
我们提出了一个开源工具,用于可视化基于Transformer的语言表示模型中的多头自注意力。该工具通过以三种粒度可视化注意力扩展了早期工作:注意力头级别、模型级别和神经元级别。我们描述了这些视图如何帮助解释模型,并在BERT模型和OpenAI GPT-2模型上演示了该工具。我们还提出了分析GPT-2的三个用例:检测模型偏差、识别重复模式以及将神经元与模型行为相关联。
引用
@article{arxiv.1904.02679,
title = {Visualizing Attention in Transformer-Based Language Representation Models},
author = {Jesse Vig},
journal= {arXiv preprint arXiv:1904.02679},
year = {2019}
}