中文

基于 LLM 的层次化概念分解用于可解释的细粒度图像分类

计算机视觉与模式识别 2024-06-04 v2 计算与语言

摘要

近期在视觉-语言任务上实现可解释模型的进展取得了竞争性能;然而,其可解释性常常因依赖大型语言模型(LLMs)提供的非结构化文本输出而受到影响。这引入了随机性,妨碍了透明度和可靠性,这些是解决AI系统安全问题的关键要素。我们引入了\texttt{Hi-CoDe}(层次化概念分解),一种旨在通过结构化概念分析增强模型可解释性的 novel 框架。我们的方法包含两个主要组件:(1)我们使用GPT-4将输入图像分解为结构化的视觉概念层次,从而形成视觉概念树。(2)我们随后采用一套简单的线性分类器,这些分类器 operate on concept-specific features 从CLIP 中派生。我们的做法不仅与最先进的模型性能相当,而且通过提供清晰的决策过程见解并突出显示各种概念的重要性,推进了透明度。这允许对潜在故障模式进行详细分析,并提高模型的紧凑性,从而在不牺牲准确性的前提下,为可解释性树立了新的基准。

关键词

引用

@article{arxiv.2405.18672,
  title  = {LLM-based Hierarchical Concept Decomposition for Interpretable Fine-Grained Image Classification},
  author = {Renyi Qu and Mark Yatskar},
  journal= {arXiv preprint arXiv:2405.18672},
  year   = {2024}
}