LRP 与 Transformer 中的 Leave-One-Out 的差异
机器学习
2025-10-22 v1
摘要
Leave-One-Out(LOO)提供了一种直观的特征重要性度量方式,但计算代价高昂。虽然Layer-Wise Relevance Propagation(LRP)可能提供一种高效替代方案,但其在现代Transformer模型中的公理论正确性仍 largely 未被充分考察。本文首先展示,近期AttnLRP中使用的双线性传播规则违反了实现不变性公理。我们对此进行解析分析,并在线性注意力层中进行经验验证。其次,我们也重新审视CP-LRP作为诊断基准,发现绕过softmax层进行相关性传播——即仅通过值矩阵反向传播相关性——显著改善了与LOO的对齐,尤其在Transformer的中后层中效果更为明显。总体而言,我们的结果表明:(i)双线性因子化灵敏性和(ii)softmax传播误差可能共同削弱了LRP在Transformer中近似LOO的能力。
引用
@article{arxiv.2510.18810,
title = {When LRP Diverges from Leave-One-Out in Transformers},
author = {Weiqiu You and Siqi Zeng and Yao-Hung Hubert Tsai and Makoto Yamada and Han Zhao},
journal= {arXiv preprint arXiv:2510.18810},
year = {2025}
}
备注
BlackboxNLP @ EMNLP 2025