中文

VISIT:可视化与解释Transformer的语义信息流

计算与语言 2023-11-27 v2

摘要

可解释性方面的近期进展表明,我们可以将基于Transformer的语言模型(LMs)的权重与隐藏状态投影到其词表上,这一变换使它们更具人类可解释性。本文中,我们研究LM的注意力头与记忆值,即模型在处理给定输入时动态创建并调用的向量。通过分析它们通过该投影所表示的词元,我们识别了注意力机制内部信息流的规律。基于我们的发现,我们创建了一个工具,将生成式预训练Transformer(GPTs)的前向传播可视化为交互式流图,其中节点表示神经元或隐藏状态,边表示它们之间的交互。我们的可视化将海量数据简化为易读的图,可反映模型内部处理过程,揭示各组件对模型最终预测的贡献。我们的可视化还揭示了层归一化作为影响模型输出的语义过滤器的新的见解,以及在前向传播中始终被激活并充当正则化向量的神经元。

关键词

引用

@article{arxiv.2305.13417,
  title  = {VISIT: Visualizing and Interpreting the Semantic Information Flow of Transformers},
  author = {Shahar Katz and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2305.13417},
  year   = {2023}
}

备注

EMNLP Findings 2023