MM-SHAP:一种用于度量视觉与语言模型及任务中多模态贡献的与性能无关的度量
计算机视觉与模式识别
2024-09-20 v3 计算与语言
摘要
视觉与语言模型(VL)已知会利用各模态中不健全的指标(例如由分布偏差引入的)而非关注各模态中的相关信息。单模态模型在 VL 任务上取得与多模态模型相近的准确率,表明发生了所谓的单模态坍缩。然而,基于准确率的测试无法检测到例如模型预测错误但模型使用了某模态相关信息的情况。为此,我们提出 MM-SHAP,一种基于 Shapley 值的与性能无关的多模态分数,可可靠量化多模态模型使用各单独模态的比例。我们以两种方式应用 MM-SHAP:(1)比较模型的平均多模态程度;(2)为单个模型度量不同任务与数据集下各模态的贡献。在四个 VL 任务上用六个 VL 模型——LXMERT、CLIP 及四个 ALBEF 变体——进行的实验强调,单模态坍缩可能以不同程度与不同方向发生,这与单模态坍缩是单方面的普遍假设相矛盾。基于我们的结果,我们推荐 MM-SHAP 用于分析多模态任务,以诊断并指导朝向多模态集成的进展。代码见 \url{https://github.com/Heidelberg-NLP/MM-SHAP}。
引用
@article{arxiv.2212.08158,
title = {MM-SHAP: A Performance-agnostic Metric for Measuring Multimodal Contributions in Vision and Language Models & Tasks},
author = {Letitia Parcalabescu and Anette Frank},
journal= {arXiv preprint arXiv:2212.08158},
year = {2024}
}
备注
Published at ACL 2023 Main (Toronto); 10 pages, 14 appendix pages, 11 figures, 3 tables