VP-MEL:基于视觉提示的多模态实体链接
计算机视觉与模式识别
2025-02-18 v4 计算与语言
摘要
多模态实体链接(MEL)是将多模态上下文中的提及链接到知识库中对应实体的任务,因其在近年来受到广泛关注。然而,现有MEL方法常依赖提及词汇作为检索线索,限制其有效利用图像和文本双方信息的能力。这种依赖导致MEL在特定场景下难以准确检索实体,尤其是当焦点在图像对象或提及词汇从文本中缺失时。为解决这些问题,本文引入基于视觉提示的多模态实体链接(VP-MEL)任务。给定文本图像对,VP-MEL旨在将图像中标记区域(即视觉提示)链接到知识库中的对应实体。为促进该任务,本文构建了一个专为VP-MEL设计的新数据集VPWiki。进一步,我们提出了一种名为IIER的框架,该框架利用视觉提示增强视觉特征提取,并利用预训练的Detective-VLM模型捕获潜在信息。在VPWiki数据集上的实验结果表明,IIER在VP-MEL任务的多个基准测试中超越基线方法。
引用
@article{arxiv.2412.06720,
title = {VP-MEL: Visual Prompts Guided Multimodal Entity Linking},
author = {Hongze Mi and Jinyuan Li and Xuying Zhang and Haoran Cheng and Jiahao Wang and Di Sun and Gang Pan},
journal= {arXiv preprint arXiv:2412.06720},
year = {2025}
}