中文

量化 Transformer 中的上下文混合

计算与语言 2023-02-09 v2 机器学习

摘要

自注意力权重及其变换变体一直是分析基于Transformer模型中词符间交互的主要信息来源。但尽管易于解释,这些权重并不能忠实反映模型决策,因为它们仅是编码器的一部分,且编码器层中的其他组件会对输出表示中的信息混合产生显著影响。本工作中,通过将分析范围扩展至整个编码器块,我们提出Value Zeroing,一种为Transformer定制的新型上下文混合分数,使我们更深入理解信息在各编码器层如何混合。我们通过一系列基于语言知理性依据、探测与忠实性分析的具有不同视角的互补评估,展示了我们的上下文混合分数相对于其他分析方法的优越性。

关键词

引用

@article{arxiv.2301.12971,
  title  = {Quantifying Context Mixing in Transformers},
  author = {Hosein Mohebbi and Willem Zuidema and Grzegorz Chrupała and Afra Alishahi},
  journal= {arXiv preprint arXiv:2301.12971},
  year   = {2023}
}

备注

Accepted to EACL 2023 (main)