中文

视觉机理可解释性:KL 最小软约束原理的分布视图

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

当前视觉机理可解释性 (MI) 大多数范式局限于通过启发式方法(如 top-K 激活检索或带正则化的优化)解释视觉模型的内部单元。在本工作中,我们建立一种视觉 MI 的理论分布视图,将特征激活对自然图像分布的影响建模,从而形成 Kullback-Leibler (KL) 最小优化问题来建模 MI 任务。在此框架下,识别出以往 MI 范式中的统计偏差,揭示它们要么对人类感知无解释性(即偏离自然图像分布),要么对视觉模型在机制上不忠实(即无法激活模型特征)。为解决这些偏差,我们提出一种基于 KL 最小软约束原理的模型,理论上平衡可解释性与忠实性。我们通过能量引导的扩散后验采样实现了该原理。广泛实验验证了所提出分布视图的理论正确性,并在 DINOv3 视觉模型上展示了我们方法范式的实际有效性。

关键词

引用

@article{arxiv.2605.17504,
  title  = {A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle},
  author = {Guancheng Zhou and Yisi Luo and Zhengfu He and Zhenyu Jin and Xuyang Ge and Wentao Shu and Deyu Meng and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2605.17504},
  year   = {2026}
}