中文

通过潜在视觉-语义滤波器注意力解释深度卷积神经网络

计算机视觉与模式识别 2022-04-12 v1 人工智能 机器学习

摘要

可解释性是视觉模型的一个重要属性,因为它帮助研究者和用户理解复杂模型的内部机制。然而,在没有直接监督来产生此类解释的情况下,生成关于所学表示的语义解释是具有挑战性的。我们提出一个通用框架,潜在视觉语义解释器(LaViSE),以教导任何现有的卷积神经网络生成关于其在滤波器层面的自身潜在表示的文本描述。我们的方法使用通用图像数据集(利用图像和类别名称)构建视觉与语义空间之间的映射。然后将该映射迁移到没有语义标签的目标域。所提出的框架采用模块化结构,并能够分析任何已训练的网络,无论其原始训练数据是否可用。我们展示了我们的方法可以生成超越训练数据集中所定义类别集合的针对所学滤波器的全新描述,并在多个数据集上进行了广泛评估。我们还展示了我们方法的一种新应用,用于无监督数据集偏差分析,使我们能够自动发现数据集中的隐藏偏差或比较不同子集而无需使用额外标签。数据集和代码已公开以促进进一步研究。

关键词

引用

@article{arxiv.2204.04601,
  title  = {Explaining Deep Convolutional Neural Networks via Latent Visual-Semantic Filter Attention},
  author = {Yu Yang and Seungbae Kim and Jungseock Joo},
  journal= {arXiv preprint arXiv:2204.04601},
  year   = {2022}
}

备注

To appear in CVPR 2022 (oral presentation)