基于二阶归因解释 CLIP 模型中的图文相互作用
计算机视觉与模式识别
2025-08-14 v4 人工智能
计算与语言
摘要
双编码器架构(如 CLIP 模型)将两种类型的输入映射到共享嵌入空间,并预测它们之间的相似性。尽管这些模型在广泛应用中发挥着重要作用,但它们如何比较两个输入仍不为人所理解。常见的一阶特征归因方法仅能解释单个特征的重要性,因而只能为双编码器的预测(其依赖于特征之间相互作用)提供有限的见解。本文首先推导出一种二阶方法,使其能够对任何可微分的双编码器对输入特征之间的相互作用进行归因。随后,我们将该方法应用于 CLIP 模型,展示它们学习了图文输入中各部分之间的细粒度对应关系。它们在不同输入模式之间匹配对象,同时也能处理不匹配的情况。这种内在的视觉-语言 grounding 能力在不同对象类别之间差异较大,存在显著的跨域效应,我们能够识别出单个错误以及系统性的失效类别。代码已公开:https://github.com/lucasmllr/exCLIP
引用
@article{arxiv.2408.14153,
title = {Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions},
author = {Lucas Möller and Pascal Tilli and Ngoc Thang Vu and Sebastian Padó},
journal= {arXiv preprint arXiv:2408.14153},
year = {2025}
}
备注
Accepted at Transactions on Machine Learning Research (TMLR)