运用加权班纳夫互动解释视觉语言编码器中的相似性
计算机视觉与模式识别
2025-11-19 v2 人工智能
机器学习
摘要
语言-图像预训练(LIP)使开发能够进行零样本分类、定位、多模态检索和语义理解的视觉语言模型成为可能。已提出各种解释方法来可视化输入图像-文本对对模型相似性输出的重要性。然而,流行的显著性图仅捕获一阶归因,忽略了此类编码器固有的复杂跨模态交互作用。我们引入可信的LIP模型交互解释(FIxLIP),作为分解视觉语言编码器相似性的统一方法。FixLIP基于博弈论,我们分析如何利用加权班纳夫互动指数相较于Shapley互动量化框架获得更大的灵活性并提高计算效率。从实际角度看,我们提出了如何自然地将解释评估指标(如指向游戏和插入/删除曲线之间的面积)扩展到二阶交互解释的方法。在MS COCO和ImageNet-1k基准测试上进行实验验证,二阶方法如FixLIP均优于一阶归因方法。除提供高质量解释外,我们展示了FixLIP在比较不同模型(如CLIP vs. SigLIP-2)方面的实用性。
引用
@article{arxiv.2508.05430,
title = {Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions},
author = {Hubert Baniecki and Maximilian Muschalik and Fabian Fumagalli and Barbara Hammer and Eyke Hüllermeier and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2508.05430},
year = {2025}
}
备注
NeurIPS 2025. Code: https://github.com/hbaniecki/fixlip