中文

基于多粒度查询引导的集成预测网络用于 grounding 多模态命名实体识别

信息检索 2025-01-28 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

基于 grounding 的多模态命名实体识别(GMNER)是一种新兴的信息抽取(IE)任务,旨在从给定的句子图像对数据中同时抽取实体跨度、类型以及对应的视觉区域。最近的统一方法采用机器阅读理解或序列生成为基础框架,在此困难任务上表现有限。前者利用人类设计的类型查询,难以区分含糊实体,例如Jordan(人物)和off-White x Jordan(鞋子)。后者遵循逐个解码顺序,存在暴露偏差问题。我们认为这些作品误解了多模态实体之间的关系。为解决这些问题,我们提出了一种名为多粒度查询引导集成预测网络(Multi-grained Query-guided Set Prediction Network, MQSPN)的新型统一框架,以学习实体内及实体间的合适关系。具体而言,MQSPN通过采用一组可学习的查询来强化实体内连接,从而显式地将文本实体与视觉区域对齐。基于不同的实体内建模,MQSPN将GMNER重新表述为集成预测,引导模型从全局匹配的优化角度建立适当的实体间关系。此外,我们还将查询引导的融合网络(QFNet)作为黏合剂网络,以提升两种层次关系的对齐效果。广泛的实验表明,我们的方法在广泛使用的基准数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2407.21033,
  title  = {Multi-Grained Query-Guided Set Prediction Network for Grounded Multimodal Named Entity Recognition},
  author = {Jielong Tang and Zhenxing Wang and Ziyang Gong and Jianxing Yu and Xiangwei Zhu and Jian Yin},
  journal= {arXiv preprint arXiv:2407.21033},
  year   = {2025}
}

备注

13 pages, 7 figures