通过解耦最优传输概念瓶颈模型发现细粒度视觉-概念关系
计算机视觉与模式识别
2025-05-13 v1
摘要
概念瓶颈模型(CBM)试图通过在输入图像和输出预测之间探索一个中间概念空间,使决策过程透明化。现有的 CBM 仅学习整个图像与概念之间的粗粒度关系,较少考虑局部图像信息,导致两个主要缺点:i)它们经常产生虚假的视觉-概念关系,从而降低模型可靠性;ii)尽管 CBM 可以解释每个概念对最终预测的重要性,但指出哪个视觉区域产生了该预测仍然具有挑战性。为解决这些问题,本文提出一个解耦最优传输 CBM(DOT-CBM)框架,以探索局部图像块与概念之间的细粒度视觉-概念关系。具体而言,我们将概念预测过程建模为图像块与概念之间的传输问题,从而实现显式的细粒度特征对齐。我们还在模态内引入正交投影损失以增强局部特征解耦。为进一步解决数据中统计偏差导致的捷径问题,我们利用视觉显著性图和概念标签统计作为传输先验。因此,DOT-CBM 可以可视化反演热力图,提供更可靠的概念预测,并产生更准确的类别预测。综合实验表明,我们提出的 DOT-CBM 在图像分类、局部部件检测和分布外泛化等多个任务上达到了 SOTA 性能。
引用
@article{arxiv.2505.07209,
title = {Discovering Fine-Grained Visual-Concept Relations by Disentangled Optimal Transport Concept Bottleneck Models},
author = {Yan Xie and Zequn Zeng and Hao Zhang and Yucheng Ding and Yi Wang and Zhengjue Wang and Bo Chen and Hongwei Liu},
journal= {arXiv preprint arXiv:2505.07209},
year = {2025}
}
备注
CVPR 2025