B-cosification:将深度神经网络转化为固有可解释性
计算机视觉与模式识别
2025-01-28 v2 人工智能
机器学习
摘要
B-cos 网络已被证明能够通过架构上强制输入与权重之间更强的对齐,有效获得对模型决策的高度人类可解释性。B-cos 版本的卷积网络(CNN)和视觉变压器(ViT),主要通过将线性层替换为 B-cos 变换,在性能上与各自的标准变体具有竞争力,同时还能提供本质上忠实的可解释性。然而,到目前为止,有必要从头训练这些模型,这在大型预训练基础模型时代正变得越来越不可行。在这项工作中,受标准 DNN 和 B-cos 网络之间架构相似性的启发,我们提出了"B-cosification",一种将现有预训练模型转化为固有可解释性的新方法。我们对卷积神经网络和视觉变压器的转换设计选择进行了全面研究。我们发现,B-cosification 能够在可解释性方面达到与从头训练的 B-cos 模型相当的水平,同时在分类性能方面往往优于它们,且训练成本仅为后者的一小部分。随后,我们将 B-cosification 应用于预训练的 CLIP 模型,并表明即使数据和计算成本有限,我们也能获得一个高度可解释且在多种数据集上零样本性能具有竞争力的 B-cosified 版本。我们在 https://github.com/shrebox/B-cosification 发布了代码和预训练模型权重。
引用
@article{arxiv.2411.00715,
title = {B-cosification: Transforming Deep Neural Networks to be Inherently Interpretable},
author = {Shreyash Arya and Sukrut Rao and Moritz Böhle and Bernt Schiele},
journal= {arXiv preprint arXiv:2411.00715},
year = {2025}
}
备注
31 pages, 9 figures, 12 tables, Neural Information Processing Systems (NeurIPS) 2024; added references, corrected typos