DWE+:面向多模态实体链接的双向匹配增强框架
人工智能
2024-04-11 v1 计算与语言
计算机视觉与模式识别
摘要
多模态实体链接(MEL)旨在利用多模态信息(通常是文本和视觉信息)将歧义提及链接到知识库中的无歧义实体。当前方法面临的主要问题包括:(1)将整个图像作为输入可能包含冗余信息;(2)实体相关信息(如图像中的属性)利用不足;(3)知识库中的实体与其表示之间的语义不一致。为此,我们提出了用于多模态实体链接的DWE+。DWE+能够捕获更细粒度的语义,并动态保持与实体的语义一致性。这是通过三个方面实现的:(a)我们引入了一种通过将图像分割为多个局部对象来提取细粒度图像特征的方法。然后,使用层次对比学习进一步对齐粗粒度信息(文本和图像)与细粒度信息(提及和视觉对象)之间的语义。(b)我们探索了从图像中提取视觉属性(如面部特征和身份)以增强融合特征的方法。(c)我们利用Wikipedia和ChatGPT捕获实体表示,从静态和动态两个角度实现语义丰富,从而更好地反映真实世界的实体语义。在Wikimel、Richpedia和Wikidiverse数据集上的实验证明了DWE+在提升MEL性能方面的有效性。具体来说,我们优化了这些数据集,并在增强后的数据集上取得了最先进的性能。代码和增强数据集已在 https://github.com/season1blue/DWET 上发布。
引用
@article{arxiv.2404.04818,
title = {DWE+: Dual-Way Matching Enhanced Framework for Multimodal Entity Linking},
author = {Shezheng Song and Shasha Li and Shan Zhao and Xiaopeng Li and Chengyu Wang and Jie Yu and Jun Ma and Tianwei Yan and Bin Ji and Xiaoguang Mao},
journal= {arXiv preprint arXiv:2404.04818},
year = {2024}
}
备注
under review on TOIS. arXiv admin note: substantial text overlap with arXiv:2312.11816