通过解释方法比较Transformer与CNN的决策机制
计算机视觉与模式识别
2024-06-25 v5
摘要
为深入理解不同视觉识别骨干网络的决策机制,我们提出两种方法论——子解释计数与交叉测试,它们在全数据集尺度上系统性地应用深度解释算法,并比较由解释的数量与性质生成的统计特征。这些方法揭示了网络在称为组合性与析取性的两种属性上的差异。研究发现 Transformer 与 ConvNeXt 更具组合性,即它们在构建决策时联合考虑图像的多个部分;而传统CNN与蒸馏Transformer组合性较弱且更具析取性,意味着它们使用多个多样但较小的部分集合来实现高置信预测。通过进一步实验,我们指出归一化方式的选择对模型的组合性尤为关键:批归一化导致较低组合性,而组归一化与层归一化则带来更高组合性。最后,我们还分析了不同骨干网络共享的特征,并基于其特征使用相似度绘制了不同模型的分布图谱。
引用
@article{arxiv.2212.06872,
title = {Comparing the Decision-Making Mechanisms by Transformers and CNNs via Explanation Methods},
author = {Mingqi Jiang and Saeed Khorram and Li Fuxin},
journal= {arXiv preprint arXiv:2212.06872},
year = {2024}
}
备注
25 pages with 37 figures, to be published in CVPR24. Project Webpage: https://mingqij.github.io/projects/cdmmtc/