中文

探测方法:提高后置解释的简单而有效技术

计算机视觉与模式识别 2025-03-04 v1

摘要

后置重要归因方法是流行的“解释”深度神经网络 (DNN) 的工具,本质上基于解释可以独立于模型训练方式应用的假设。相反,本文我们提出了实证证据,挑战了这一观念。我们惊讶地发现,预训练模型分类层(不足 10% 模型参数)的训练细节对解释产生强烈依赖,并且 demonstrat(证明)这一点。对于实际应用来说,这一发现具有高度的相关性:(1)由于预训练模型的技术日益多样化,理解这些技术与归因方法之间的相互作用至关重要;(2)它揭示了一个被严重忽视的后置归因方法的重要假设,可能显著影响模型解释以及最终如何解释。基于这一发现,我们还提出了简单而有效的分类层调整,以显著提高模型解释的质量。我们在多个视觉预训练框架(完全监督、自监督、对比式视觉语言训练)上进行了验证,并分析了它们对解释的影响,这些解释适用于广泛的归因方法和多样化的评估指标。

关键词

引用

@article{arxiv.2503.00641,
  title  = {How to Probe: Simple Yet Effective Techniques for Improving Post-hoc Explanations},
  author = {Siddhartha Gairola and Moritz Böhle and Francesco Locatello and Bernt Schiele},
  journal= {arXiv preprint arXiv:2503.00641},
  year   = {2025}
}

备注

Accepted as poster at ICLR 2025. GitHub Link: https://github.com/sidgairo18/how-to-probe