识别图像表示中的可解释子空间
计算机视觉与模式识别
2023-09-11 v2 机器学习
摘要
我们提出使用对比概念自动解释特征(FALCON),一种解释图像表示特征的 Interpretability 框架。对于目标特征,FALCON 使用大型描述数据集(如 LAION-400m)和预训练视觉-语言模型(如 CLIP)对其高激活的裁剪图像进行描述。对描述中的所有词进行打分和排序,得到少量共享的、人类可理解的概念,紧密描述目标特征。FALCON 还使用低激活(反事实)图像进行对比解释,以消除虚假概念。尽管许多现有方法独立解释特征,我们在最先进的自监督和监督模型中观察到,少于 20% 的表示空间可由单个特征解释。我们表明,较大空间中的特征在分组研究时变得更可解释,并可通过 FALCON 用高阶打分概念解释。我们讨论了提取的概念如何用于解释和调试下游任务中的失败。最后,我们提出一种技术,通过学习简单的线性变换,将一个(可解释的)表示空间中的概念迁移到另一个未见表示空间。代码见 https://github.com/NehaKalibhat/falcon-explain。
引用
@article{arxiv.2307.10504,
title = {Identifying Interpretable Subspaces in Image Representations},
author = {Neha Kalibhat and Shweta Bhardwaj and Bayan Bruss and Hamed Firooz and Maziar Sanjabi and Soheil Feizi},
journal= {arXiv preprint arXiv:2307.10504},
year = {2023}
}
备注
Published at ICML 2023 Code: https://github.com/NehaKalibhat/falcon-explain