无提案查询引导网络:面向 grounding 的多模态命名实体识别
计算机视觉与模式识别
2026-03-20 v2
摘要
Grounded Multimodal Named Entity Recognition (GMNER) 通过识别自然语言文本中的命名实体及其跨度和类型,并将其对齐到关联图像中的对应区域来实现。目前大多数方法将此任务划分为两个步骤:首先使用预训练的通用目标检测器检测物体,然后将命名实体匹配到检测到的物体上。然而,这些方法面临一个主要限制:由于预训练的通用目标检测器独立于文本实体运作,倾向于检测常见物体,频繁忽略命名实体所需的特定细粒度区域。这种检测器与实体之间的错位引入了不精确性,可能影响整体系统性能。本文提出一种无提案查询引导网络 (QGN),通过文本引导和跨模态交互统一多模态推理与解码。QGN 实现了准确的 grounding 并在开放域场景中表现出色。大量实验表明,QGN 在广泛使用的基准数据集上,以领先成绩位列各类 GMNER 模型。
引用
@article{arxiv.2603.17314,
title = {A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition},
author = {Hongbing Li and Jiamin Liu and Shuo Zhang and Bo Xiao},
journal= {arXiv preprint arXiv:2603.17314},
year = {2026}
}
备注
There is an error in the methods section