MNER-QG:一种用于带查询定位的多模态命名实体识别的端到端机器阅读理解框架
计算机视觉与模式识别
2022-11-29 v1 人工智能
计算与语言
摘要
多模态命名实体识别(MNER)是信息抽取中的关键步骤,旨在给定句-图对时检测实体跨度并将其分类至相应实体类型。现有方法要么(1)通过注意力机制从粗粒度视觉线索获取命名实体,要么(2)先使用工具包检测细粒度视觉区域再识别命名实体。然而,它们受限于实体类型与视觉区域间的不当对齐或两阶段方式中的错误传播,最终将无关视觉信息引入文本。本文提出一种新颖的端到端框架MNER-QG,可同时执行基于MRC的多模态命名实体识别与查询定位。具体而言,在查询辅助下,MNER-QG能提供实体类型与视觉区域的先验知识,并进一步增强文本与图像的表示。为执行查询定位任务,我们提供了手动标注与弱监督,后者通过迁移学习训练高度灵活的视觉定位模型获得。我们在两个公开MNER数据集Twitter2015和Twitter2017上进行了广泛实验。实验结果表明MNER-QG在MNER任务上优于当前最优模型,并提升了查询定位性能。
引用
@article{arxiv.2211.14739,
title = {MNER-QG: An End-to-End MRC framework for Multimodal Named Entity Recognition with Query Grounding},
author = {Meihuizi Jia and Lei Shen and Xin Shen and Lejian Liao and Meng Chen and Xiaodong He and Zhendong Chen and Jiaqi Li},
journal= {arXiv preprint arXiv:2211.14739},
year = {2022}
}
备注
13 pages, 6 figures, published to AAAI