中文

E2E-GMNER:面向 end-to-end 的生成式 grounding 多模态命名实体识别

计算机视觉与模式识别 2026-04-21 v1 计算与语言

摘要

基于 grounding 多模态命名实体识别(GMNER)旨在 jointly identify 文本中的命名实体提及、预测其语义类型,并将每个实体 grounding 到关联图像中的对应视觉区域。现有方法主要采用 pipeline 架构,decouple 文本实体识别和视觉 grounding,导致误差累积和次佳的 joint optimization。本文提出 E2E-GMNER,一个 fully end-to-end 的生成式框架,统一实体识别、语义类型预测、视觉 grounding 和隐式知识推理于单个 multimodal 大语言模型之内。我们将 GMNER 表述为 instruction-tuned 条件生成任务,并融入 chain-of-thought reasoning,以启用模型自适应地确定视觉证据或背景知识何时具有信息价值,减少对 noisy cues 的依赖。为进一步解决生成式边界框预测的稳定性问题,我们引入 Gaussian Risk-Aware Box Perturbation(GRBP),用概率扰动的 soft targets 替代硬边界框监督,以提高对 annotation noise 和离散化误差的鲁棒性。广泛的实验在 Twitter-GMNER 和 Twitter-FMNERG benchmark 上证明,E2E-GMNER 在与 SOTA 方法之间实现了高度具竞争力的性能,验证了 unified end-to-end optimization 和 noise-aware grounding supervision 的有效性。代码可用:https://github.com/Finch-coder/E2E-GMNER

关键词

引用

@article{arxiv.2604.17319,
  title  = {E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition},
  author = {Meng Zhang and Jinzhong Ning and Xiaolong Wu and Hongfei Lin and Yijia Zhang},
  journal= {arXiv preprint arXiv:2604.17319},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026