在嵌入空间中分析 Transformer
计算与语言
2023-12-27 v3 机器学习
摘要
理解基于 Transformer 的模型引起了显著关注,因为它们处于机器学习近期技术进步的核心。尽管大多数可解释性方法依赖于在输入上运行模型,但近期工作表明,一种零次传递方法(即直接解释参数而无需前向/反向传递)对于一些 Transformer 参数以及两层注意力网络是可行的。在本工作中,我们提出一种理论分析,通过将训练好的 Transformer 的所有参数投影到嵌入空间(即它们所操作的词汇项空间)中来解释这些参数。我们推导了一个简单的理论框架来支持我们的论点,并提供了充分的证据证明其有效性。首先,一项实证分析表明预训练和微调模型的参数都可以在嵌入空间中被解释。其次,我们展示了我们框架的两个应用:(a)对齐共享词表的的不同模型的参数,以及(b)通过将微调分类器的参数“翻译”为仅经过预训练的不同模型的参数,无需训练地构建分类器。总体而言,我们的发现为可解释性方法打开了大门,这些方法至少部分地抽象掉模型细节,并仅在嵌入空间中运作。
引用
@article{arxiv.2209.02535,
title = {Analyzing Transformers in Embedding Space},
author = {Guy Dar and Mor Geva and Ankit Gupta and Jonathan Berant},
journal= {arXiv preprint arXiv:2209.02535},
year = {2023}
}