DeViL:将视觉特征解码为语言
计算机视觉与模式识别
2023-09-06 v1 人工智能
机器学习
摘要
事后解释方法常因抽象掉深度神经网络的决策过程而受到批评。本工作中,我们期望为视觉骨干网络不同层所学习到的内容提供自然语言描述。我们的DeViL方法将视觉特征解码为语言,不仅高亮归因位置,还生成网络不同层视觉特征的文本描述。我们训练一个transformer网络,将任意视觉层的单个图像特征翻译为提示,由一个独立的现成语言模型解码为自然语言。通过在每层与每个空间位置使用dropout,我们的模型能将基于图像-文本对的训练泛化以生成局部化解释。由于使用了预训练语言模型,我们的方法训练快速、可应用于任意视觉骨干,并能在视觉网络的不同层产生文本描述。此外,DeViL能创建对应于词汇或短语的开放词表归因图,即便这些词超出视觉模型的训练范围。我们证明DeViL在CC3M上生成与图像内容相关的文本描述,超越此前的轻量描述模型,其归因图揭示了视觉骨干学习到的概念。最后,我们展示DeViL在MILANNOTATIONS数据集的神经元级描述上也优于当前SOTA。代码见 https://github.com/ExplainableML/DeViL
引用
@article{arxiv.2309.01617,
title = {DeViL: Decoding Vision features into Language},
author = {Meghal Dani and Isabel Rio-Torto and Stephan Alaniz and Zeynep Akata},
journal= {arXiv preprint arXiv:2309.01617},
year = {2023}
}
备注
Accepted at GCPR 2023 (Oral)