中文

概念可视化:使用WordNet解释CLIP多模态嵌入

计算机视觉与模式识别 2024-05-24 v1 人工智能

摘要

多模态嵌入的进展,特别是CLIP,最近推动了计算机视觉(CV)的若干突破。CLIP在各种任务上展示了令人印象深刻的性能,然而,其本质上不透明的架构可能会阻碍使用CLIP作为骨干的模型的应用,尤其是在信任和模型可解释性至关重要的领域,例如医学领域。当前CV模型的解释方法依赖于通过梯度分析或输入扰动计算的显著性图。然而,这些显著性图只能用于解释与最终任务相关的类别,其范围通常小于骨干训练类别。在将CLIP作为视觉骨干的模型中,嵌入表示中嵌入的很大一部分信息因此未被解释。在这项工作中,我们提出了概念可视化(ConVis),一种新颖的显著性方法,通过利用嵌入的多模态性质来解释图像的CLIP嵌入。ConVis利用WordNet的词汇信息来计算任何概念的任务无关显著性图,不限于最终模型训练过的概念。我们通过分布外检测实验验证了WordNet的使用,并在对象定位基准上测试了ConVis,表明概念可视化能够正确识别和定位图像的语义内容。此外,我们进行了一项用户研究,证明我们的方法可以让用户深入了解模型的功能。

关键词

引用

@article{arxiv.2405.14563,
  title  = {Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet},
  author = {Loris Giulivi and Giacomo Boracchi},
  journal= {arXiv preprint arXiv:2405.14563},
  year   = {2024}
}

备注

Accepted for publication at IJCNN 2024