基于Shapley值的对比式对齐用于多模态信息提取
人工智能
2024-07-26 v1 计算与语言
多媒体
摘要
社交媒体的兴起以及多模态交互的指数级增长,使得对多模态信息提取(MIE)的高级技术需求日益迫切。然而,现有方法主要依赖直接的图像-文本交互,这种范式常面临由于图像与文本之间语义和模态差距带来的显著挑战。本文引入一种新的图像-上下文-文本交互范式,利用大型多模态模型(LMM)生成描述性文本上下文以桥接这些差距。基于此范式,我们提出了一种基于Shapley值的对比式对齐方法(Shap-CA),该方法对齐上下文-文本和上下文-图像对。Shap-CA 首先应用博弈论中的Shapley值概念,对上下文、文本和图像中每个元素的贡献进行量化评估,以衡量其对总体语义和模态重叠的影响。随后,采用对比学习策略以增强上下文-文本/图像对内部的交互贡献,同时最小化跨对之间的影响。此外,我们设计了用于选择性跨模态融合的自适应融合模块。广泛的实验在四个 MIE 数据集上表明,我们的方法显著优于现有的领先方法。
引用
@article{arxiv.2407.17854,
title = {Shapley Value-based Contrastive Alignment for Multimodal Information Extraction},
author = {Wen Luo and Yu Xia and Shen Tianshu and Sujian Li},
journal= {arXiv preprint arXiv:2407.17854},
year = {2024}
}
备注
Accepted at ACM Multimedia 2024