基于视觉-语言模型的神经网络概念分析
机器学习
2024-04-12 v3 人工智能
计算与语言
计算机视觉与模式识别
计算机科学中的逻辑
摘要
对基于视觉的深度神经网络(DNNs)进行分析是非常可取的,但由于难以表达视觉任务的形式化规范以及缺乏高效的验证程序,这极具挑战性。在本文中,我们提出利用新兴的多模态、视觉-语言基础模型(VLMs)作为透镜,通过它我们可以对视觉模型进行推理。视觉-语言模型已在大量配有文本描述的图像上进行了训练,因此隐式地意识到描述图像的高层、人类可理解的概念。我们描述了一种逻辑规范语言 Con_spec,旨在便于根据这些概念编写规范。为了定义并形式化地检查 Con_spec 规范,我们在给定视觉模型的内部表示与视觉-语言模型之间建立了一个映射,从而形成了一种针对视觉模型自然语言属性的高效验证程序。我们使用 CLIP 作为多模态模型,在基于 ResNet 并在 RIVAL-10 数据集上训练的分类器上演示了我们的技术。
引用
@article{arxiv.2403.19837,
title = {Concept-based Analysis of Neural Networks via Vision-Language Models},
author = {Ravi Mangal and Nina Narodytska and Divya Gopinath and Boyue Caroline Hu and Anirban Roy and Susmit Jha and Corina Pasareanu},
journal= {arXiv preprint arXiv:2403.19837},
year = {2024}
}