DINO-QPM: 为全局可解释图像分类适配视觉基础模型
人机交互
2026-04-09 v1
摘要
虽然视觉基础模型如DINOv2作为特征提取器提供了最先进的性能,但其复杂的高维表示为可解释性带来了重大挑战。本工作提出DINO-QPM,将这些强大但纠缠的特征转换为对比型、与类别无关的表示,使其对人类可解释。DINO-QPM是一种轻量级可解释性适配器,旨在实现全局可解释的图像分类,将Quadratic Programming Enhanced Model (QPM) 适配到严格冻结的DINO骨干网络上。虽然视觉基础模型的分类通常依赖\texttt{CLS} token,但我们刻意远离这一标准。通过利用平均池化,我们直接将patch嵌入连接到模型特征,从而使DINO-QPM的全局可解释特征在输入空间中实现空间局部化。此外,我们应用稀疏损失以最小化空间散布和背景噪声,确保解释局限于相关物体部件。通过DINO-QPM,我们将QPM的可解释性水平作为一种适配器实现,同时超越DINOv2线性探测器的准确率。通过引入的可信度指标和其他可解释性指标进行评估,广泛的实验表明,DINO-QPM在冻结视觉基础模型中在分类准确率和解释质量方面均优于其他适用方法。
引用
@article{arxiv.2604.07167,
title = {Critical Inker: Scaffolding Critical Thinking in AI-Assisted Writing Through Socratic Questioning},
author = {Philipp Hugenroth and Valdemar Danry and Pattie Maes},
journal= {arXiv preprint arXiv:2604.07167},
year = {2026}
}