中文

关键点计数分类器:无需训练将视觉转换器转化为自解释模型

计算机视觉与模式识别 2025-12-22 v1

摘要

当前设计自解释模型(SEMs)的方法需要复杂的训练程序和特定网络结构,使其在实际应用中不够可行。随着基于视觉转换器(ViT)的通用基础模型的发展,这种不可行性问题更加突出。因此,亟需新方法为ViT基础模型提供透明度和可靠性。在本工作中,我们提出了一种将任何已训练良好的ViT模型转化为无需重新训练的SEMs的方法,称为关键点计数分类器(Keypoint Counting Classifiers, KCCs)。近期研究表明ViT能够以高精度自动识别图像间的匹配关键点,我们基于这些结果构建了一种易于解释且固有可视化于输入中的决策过程。我们进行了广泛的评估,表明KCCs在与最新基线方法相比能显著改善人机间的沟通。我们认为KCCs是实现ViT基础模型更透明和可靠的重要一步。

关键词

引用

@article{arxiv.2512.17891,
  title  = {Keypoint Counting Classifiers: Turning Vision Transformers into Self-Explainable Models Without Training},
  author = {Kristoffer Wickstrøm and Teresa Dorszewski and Siyan Chen and Michael Kampffmeyer and Elisabeth Wetzer and Robert Jenssen},
  journal= {arXiv preprint arXiv:2512.17891},
  year   = {2025}
}