Make it SING:分析分类器中的语义不变量
计算机视觉与模式识别
2026-03-18 v2 图像与视频处理
摘要
所有分类器,包括最先进的视觉模型,都具有不变量,这些不变量部分根植于其线性映射的几何。这些不变量位于分类器的零空间中,诱导一组等效的输入映射到相同的输出。这些不变量的语义内容尚不清晰,因为现有方法难以提供人类可解释的信息。为解决这一问题,我们提出了零空间几何语义解释(SING),一种构建等效图像的方法,针对网络分配语义解释。我们使用从网络特征到多模态视觉语言模型的映射。这使我们能够获得自然语言描述和视觉等效图像的语义变化。SING可以应用于单个图像,揭示局部不变量,也可以应用于图像集,允许在类别和模型层面进行广泛的统计分析。例如,我们的方法揭示了ResNet50将相关语义属性泄露给零空间,而DinoViT这种以自监督DINO预训练的ViT在保持类语义方面优于等效空间。
引用
@article{arxiv.2603.14610,
title = {Make it SING: Analyzing Semantic Invariants in Classifiers},
author = {Harel Yadid and Meir Yossef Levi and Roy Betser and Guy Gilboa},
journal= {arXiv preprint arXiv:2603.14610},
year = {2026}
}
备注
Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026