DecoderLens:编码器-解码器 Transformer 的逐层解释
计算与语言
2024-04-04 v2
摘要
近年来,人们提出了许多可解释性方法,以不同精度和复杂度帮助解释 Transformer 模型的内部状态。在此,为分析编码器-解码器 Transformer,我们提出一种简单的新方法:DecoderLens。受 LogitLens(用于仅解码器 Transformer)的启发,该方法允许解码器交叉注意力于中间编码器层的表示,而非像编码器-解码器模型中通常所做的那样使用最终编码器输出。因此,该方法将先前不可解释的向量表示映射到人类可解释的单词或符号序列。我们报告了将 DecoderLens 应用于在问答、逻辑推理、语音识别和机器翻译上训练的模型的结果。DecoderLens 揭示了在较低或中间层解决的若干特定子任务,为这类重要模型编码器组件内部的信息流提供了新见解。
引用
@article{arxiv.2310.03686,
title = {DecoderLens: Layerwise Interpretation of Encoder-Decoder Transformers},
author = {Anna Langedijk and Hosein Mohebbi and Gabriele Sarti and Willem Zuidema and Jaap Jumelet},
journal= {arXiv preprint arXiv:2310.03686},
year = {2024}
}
备注
Accepted to Findings of NAACL 2024