视觉命名实体链接:一个新数据集与基线
计算机视觉与模式识别
2022-11-10 v1 人工智能
摘要
视觉实体链接是一项将图像区域与知识库中对应实体链接起来的任务,这对许多计算机视觉任务(如图像检索、图像描述和视觉问答)都有益处。虽然现有的视觉实体链接任务要么依赖文本数据来补充多模态链接,要么仅将对象与通用实体链接,这无法对大量图像数据执行命名实体链接。在本文中,我们考虑一个纯基于视觉的命名实体链接任务,其输入仅包含一张图像。该任务旨在识别图像中的感兴趣对象(即视觉实体提及),并将它们链接到知识库中对应的命名实体。由于每个实体在知识库中通常包含丰富的视觉和文本信息,我们因此提出了三个不同的子任务,即视觉到视觉实体链接、视觉到文本实体链接和视觉到视觉-文本实体链接。此外,我们提出了一个高质量的人工标注视觉人物链接数据集,名为 WIKIPerson。基于 WIKIPerson,我们为每个子任务的解决方案建立了一系列基线算法,并进行实验以验证所提出数据集的质量和基线方法的有效性。我们期望这项工作有助于在未来征集更多关于视觉命名实体链接的研究。代码和数据集已在 https://github.com/ict-bigdatalab/VNEL 上公开。
引用
@article{arxiv.2211.04872,
title = {Visual Named Entity Linking: A New Dataset and A Baseline},
author = {Wenxiang Sun and Yixing Fan and Jiafeng Guo and Ruqing Zhang and Xueqi Cheng},
journal= {arXiv preprint arXiv:2211.04872},
year = {2022}
}
备注
13 pages, 11 figures, published to EMNLP 2022(findings)