面向多模态实体链接的多层次匹配网络
计算机视觉与模式识别
2024-12-17 v1 人工智能
摘要
多模态实体链接(Multimodal Entity Linking,以下简称 MEL)旨在将含歧义的多模态上下文中的提及链接到对应的多模态知识库中的实体。目前大多数针对 MEL 的方法基于表示学习或视觉与语言预训练机制,探索多模态之间之间的互补效应。然而,这些方法存在两个局限性:一方面,它们忽略了考虑单一模态中负样本的可能性;另一方面,它们缺乏捕捉双向跨模态相互作用的机制。为此,我们提出了一种面向多模态实体链接的多层次匹配网络(Multi-level Matching network for Multimodal Entity Linking,以下简称 M3EL)。具体而言,M3EL 由三个模块组成:(i)多模态特征提取模块,通过多模态编码器提取模态特定的表征,并引入单模态对比学习子模块,以基于单模态差异获得更具辨识度的嵌入;(ii)单模态匹配网络模块,包含两层不同的匹配粒度:粗粒度的全局到全局(Coarse-grained Global-to-Global)和细粒度的全局到局部(Fine-grained Global-to-Local),以实现局部和全局层次的单模态相互作用;(iii)跨模态匹配网络模块,应用双向策略(文本到视觉与视觉到文本匹配),以实现双向跨模态相互作用。在 WikiMEL、RichpediaMEL 和 WikiDiverse 数据集上进行的大量实验表明,M3EL 在与最先进基线方法进行比较时表现出色。
引用
@article{arxiv.2412.10440,
title = {Multi-level Matching Network for Multimodal Entity Linking},
author = {Zhiwei Hu and Víctor Gutiérrez-Basulto and Ru Li and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2412.10440},
year = {2024}
}
备注
Accepted at KDD'25