基于多模态检索的命名实体与关系抽取
计算与语言
2022-12-06 v1
摘要
多模态命名实体识别(NER)与关系抽取(RE)旨在利用相关图像信息提升NER与RE性能。现有多数工作主要关注直接从图像中提取潜在有用信息(如像素级特征、识别出的对象及关联描述)。然而,此类提取过程可能不具备知识感知能力,导致信息相关性不高。本文提出一种新颖的基于多模态检索的框架(MoRe)。MoRe包含文本检索模块与基于图像的检索模块,分别在知识语料库中检索输入文本与图像的相关知识。随后,检索结果分别送入文本与视觉模型进行预测。最后,专家混合(MoE)模块结合两模型的预测做出最终决策。我们的实验表明,文本模型与视觉模型在四个多模态NER数据集与一个多模态RE数据集上均可达到最先进性能。借助MoE,模型性能可进一步提升,且我们的分析证明了融合文本与视觉线索对此类任务的益处。
引用
@article{arxiv.2212.01612,
title = {Named Entity and Relation Extraction with Multi-Modal Retrieval},
author = {Xinyu Wang and Jiong Cai and Yong Jiang and Pengjun Xie and Kewei Tu and Wei Lu},
journal= {arXiv preprint arXiv:2212.01612},
year = {2022}
}
备注
Findings of EMNLP 2022. Code is publicly available at http://github.com/modelscope/adaseq/examples/MoRe