解构 Grad-ECLIP:其错误性及模型解释的基本原则
计算机视觉与模式识别
2026-05-14 v1
摘要
Grad-ECLIP 于 ICML 2024 发表,代表了一种新的 Transformer 解释技术路径(基于中间特征)。首先,本文表明基于中间特征的技术路径并非新颖之物。基于现有的注意力技术路径,我们开发了 Attention-ECLIP,这完全等价于 Grad-ECLIP,但计算更为简单。通过形式推导和实验验证,我们证明了由 Grad-ECLIP 表示的中间特征技术路径实际上是注意力技术路径的一个等价变体。接下来,本文表明 Grad-ECLIP 方法存在缺陷。Grad-ECLIP 获取的模型解释结果并非原模型的解释结果,且解释结果与模型性能不一致。我们分析 Grad-ECLIP 缺陷的成因,并提出,或更确切地说,明确强调两种基本原则,以避免类似错误:模型解释应遵循这些基本原则。
引用
@article{arxiv.2605.12952,
title = {Debunking Grad-ECLIP: A Comprehensive Study on Its Incorrectness and Fundamental Principles for Model Interpretation},
author = {Yongjin Cui and Xiaohui Fan},
journal= {arXiv preprint arXiv:2605.12952},
year = {2026}
}