中文

基于多模态知识库的多模态实体标注

信息检索 2022-07-29 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

为推进多模态知识库与多模态信息处理研究,我们提出一项新任务——基于多模态知识库(MKB)的多模态实体标注(MET),并利用现有MKB构建了该问题的数据集。在MKB中,包含实体及其关联的文本与图像。在MET中,给定文本-图像对,利用MKB中的信息自动识别该对中的相关实体。我们采用信息检索范式解决该任务,并使用NLP与CV中最先进的方法实现了若干基线。我们进行了大量实验并对实验结果进行分析。结果表明该任务具有挑战性,但现有技术可取得相对较高的性能。我们将发布数据集、代码与模型以供未来研究。

关键词

引用

@article{arxiv.2201.00693,
  title  = {Multimodal Entity Tagging with Multimodal Knowledge Base},
  author = {Hao Peng and Hang Li and Lei Hou and Juanzi Li and Chao Qiao},
  journal= {arXiv preprint arXiv:2201.00693},
  year   = {2022}
}

备注

11 pages, 4 figures