中文

AttentionViz:Transformer 注意力的全局视图

人机交互 2023-08-10 v2 计算与语言 计算机视觉与模式识别 机器学习

摘要

Transformer 模型正在革新机器学习,但其内部工作机制仍神秘莫测。在本工作中,我们提出了一种新可视化技术,旨在帮助研究者理解 Transformer 中的自注意力机制,该机制使这些模型能够学习序列元素之间丰富的上下文关系。我们方法的核心思想是将 Transformer 模型用于计算注意力所采用的查询向量与键向量进行联合嵌入可视化。与以往的注意力可视化技术不同,我们的方法能够跨多个输入序列分析全局模式。我们基于这些联合查询-键嵌入创建了一个交互式可视化工具 AttentionViz(演示:http://attentionviz.com),并用它来研究语言和视觉 Transformer 中的注意力机制。我们通过若干应用场景与专家反馈展示了我们的方法在增进模型理解以及提供关于查询-键交互新见解方面的效用。

关键词

引用

@article{arxiv.2305.03210,
  title  = {AttentionViz: A Global View of Transformer Attention},
  author = {Catherine Yeh and Yida Chen and Aoyu Wu and Cynthia Chen and Fernanda Viégas and Martin Wattenberg},
  journal= {arXiv preprint arXiv:2305.03210},
  year   = {2023}
}

备注

11 pages, 13 figures