DEAL: 解耦并定位视觉语言模型的概念级解释
计算机视觉与模式识别
2024-07-22 v1 人工智能
机器学习
摘要
大型预训练视觉语言模型 (VLM) 已成为其他模型和下游任务中普遍存在的基础组件。尽管功能强大,我们的实证结果表明,此类模型可能无法识别细粒度概念。具体而言,VLM 关于细粒度概念的解释是纠缠且定位错误的。为了解决这个问题,我们提出在无需人工标注的情况下,解耦并定位 (DEAL) VLM 的概念级解释。其核心思想是鼓励概念级解释彼此区分,同时保持与类别级解释的一致性。我们在广泛的基准数据集和视觉语言模型上进行了大量实验和消融研究。我们的实证结果表明,所提出的方法在解耦性和可定位性方面显著改善了模型的概念级解释。令人惊讶的是,改进的可解释性减轻了模型对虚假相关性的依赖,从而进一步提升了预测精度。
引用
@article{arxiv.2407.14412,
title = {DEAL: Disentangle and Localize Concept-level Explanations for VLMs},
author = {Tang Li and Mengmeng Ma and Xi Peng},
journal= {arXiv preprint arXiv:2407.14412},
year = {2024}
}
备注
In Proceedings of the European Conference on Computer Vision (ECCV), 2024