通过多模态信息瓶颈归因实现图像-文本表示的可视化解释
计算机视觉与模式识别
2024-06-25 v2 人工智能
机器学习
摘要
视觉-语言预训练模型取得了显著成功,但由于缺乏可解释性,它们在安全关键场景中的应用受到限制。为了提高CLIP等视觉-语言模型的可解释性,我们提出了一种多模态信息瓶颈(M2IB)方法,该方法学习压缩无关信息同时保留相关视觉和文本特征的潜在表示。我们展示了如何将M2IB应用于视觉-语言预训练模型的归因分析,提高归因准确性,并改善此类模型在医疗保健等安全关键领域的可解释性。至关重要的是,与常用的单模态归因方法不同,M2IB不需要真实标签,使得在存在多种模态但无真实数据时能够审计视觉-语言预训练模型的表示。以CLIP为例,我们展示了M2IB归因的有效性,并表明它在定性和定量上均优于基于梯度、基于扰动和基于注意力的归因方法。
引用
@article{arxiv.2312.17174,
title = {Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution},
author = {Ying Wang and Tim G. J. Rudner and Andrew Gordon Wilson},
journal= {arXiv preprint arXiv:2312.17174},
year = {2024}
}
备注
Published in Advances in Neural Information Processing Systems 36 (NeurIPS 2023)