中文

LRP 与 Transformer 中的 Leave-One-Out 的差异

机器学习 2025-10-22 v1

摘要

Leave-One-Out(LOO)提供了一种直观的特征重要性度量方式,但计算代价高昂。虽然Layer-Wise Relevance Propagation(LRP)可能提供一种高效替代方案,但其在现代Transformer模型中的公理论正确性仍 largely 未被充分考察。本文首先展示,近期AttnLRP中使用的双线性传播规则违反了实现不变性公理。我们对此进行解析分析,并在线性注意力层中进行经验验证。其次,我们也重新审视CP-LRP作为诊断基准,发现绕过softmax层进行相关性传播——即仅通过值矩阵反向传播相关性——显著改善了与LOO的对齐,尤其在Transformer的中后层中效果更为明显。总体而言,我们的结果表明:(i)双线性因子化灵敏性和(ii)softmax传播误差可能共同削弱了LRP在Transformer中近似LOO的能力。

关键词

引用

@article{arxiv.2510.18810,
  title  = {When LRP Diverges from Leave-One-Out in Transformers},
  author = {Weiqiu You and Siqi Zeng and Yao-Hung Hubert Tsai and Makoto Yamada and Han Zhao},
  journal= {arXiv preprint arXiv:2510.18810},
  year   = {2025}
}

备注

BlackboxNLP @ EMNLP 2025