中文

从局部到全局到机械化:基于 iERF 的统一视觉模型解释框架

计算机视觉与模式识别 2026-05-04 v1

摘要

现代视觉模型取得了显著的准确率,但解释证据来源、模型编码内容以及内部计算如何组装证据仍然碎片化。我们引入以 iERF 为核心的框架,将局部、全局和机械化解释统一于单个分析单元:与其实例特定有效感受野 (iERF) 配对的逐点特征向量 (PFV)。在局部层面,共享比例分解 (SRD) 将每个 PFV 表示为由上游 PFV 通过共享比例组成的混合物,并传播 iERF 以构建类别判别性热力图。SRD 产生高分辨率、激活忠实的解释,对针对性操纵和噪声鲁棒,且在常见非线性函数下保持激活中性。对于全局视图,我们引入概念锚定特征解释 (CAFE),将 iERF 用作语义标签,将抽象潜在向量锚定在可验证的像素级证据上。通过 CAFE,我们解决稀疏自编码器潜在向量非局部化的问题,尤其是在 Transformer 中,早期自注意力机制混合了远程上下文。为回答表示如何通过深度组合并成,提出具有跨层概念图与跨层概念归因 (ICAT),其量化概念间的影响,同时隔离层对;跨层插入、删除协议确定 Integrated Gradients 是最忠实的实例。实验表明,在 ResNet50、VGG16 和 ViT 上,我们的框架在忠实度和鲁棒性方面均优于基线,成功解释分散的 SAE 特征,并暴露正确分类和对抗样本中的主导概念路径。基于 iERF 的方法提供了从像素到概念再到决策的连贯、证据驱动的映射。

关键词

引用

@article{arxiv.2605.00474,
  title  = {From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models},
  author = {Yearim Kim and Sangyu Han and Nojun Kwak},
  journal= {arXiv preprint arXiv:2605.00474},
  year   = {2026}
}

备注

Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026