中文

无提案查询引导网络:面向 grounding 的多模态命名实体识别

计算机视觉与模式识别 2026-03-20 v2

摘要

Grounded Multimodal Named Entity Recognition (GMNER) 通过识别自然语言文本中的命名实体及其跨度和类型,并将其对齐到关联图像中的对应区域来实现。目前大多数方法将此任务划分为两个步骤:首先使用预训练的通用目标检测器检测物体,然后将命名实体匹配到检测到的物体上。然而,这些方法面临一个主要限制:由于预训练的通用目标检测器独立于文本实体运作,倾向于检测常见物体,频繁忽略命名实体所需的特定细粒度区域。这种检测器与实体之间的错位引入了不精确性,可能影响整体系统性能。本文提出一种无提案查询引导网络 (QGN),通过文本引导和跨模态交互统一多模态推理与解码。QGN 实现了准确的 grounding 并在开放域场景中表现出色。大量实验表明,QGN 在广泛使用的基准数据集上,以领先成绩位列各类 GMNER 模型。

关键词

引用

@article{arxiv.2603.17314,
  title  = {A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition},
  author = {Hongbing Li and Jiamin Liu and Shuo Zhang and Bo Xiao},
  journal= {arXiv preprint arXiv:2603.17314},
  year   = {2026}
}

备注

There is an error in the methods section