度量Transformer中上下文信息的混合
计算与语言
2022-10-25 v3
摘要
Transformer架构通过自注意力机制聚合输入信息,但目前尚不清楚这些信息如何在整个模型中被混合。此外,近期工作表明仅注意力权重不足以描述信息流。在本文中,我们考虑完整的注意力块——多头注意力、残差连接和层归一化——并定义了一种度量每层内词元到词元交互的指标。随后,我们聚合逐层解释,为模型预测提供输入归因分数。在实验中,我们表明我们的方法ALTI(逐层词元到词元交互聚合)比基于梯度的方法提供更忠实的解释且鲁棒性更强。
引用
@article{arxiv.2203.04212,
title = {Measuring the Mixing of Contextual Information in the Transformer},
author = {Javier Ferrando and Gerard I. Gállego and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2203.04212},
year = {2022}
}
备注
EMNLP 2022