中文

LLM 作为桥梁:重构接地多模态命名实体识别

计算机视觉与模式识别 2024-05-30 v4 计算与语言

摘要

接地多模态命名实体识别(GMNER)是一项新兴的多模态任务,旨在识别命名实体、实体类型及其对应的视觉区域。GMNER 任务表现出两个具有挑战性的特性:1) 社交媒体中图像 - 文本对之间的弱相关性导致很大一部分命名实体无法接地。2) 类似任务(如短语定位、指代表达理解)中常用的粗粒度指代表达与细粒度命名实体之间存在区别。在本文中,我们提出了 RiVEG,这是一个统一框架,通过利用大型语言模型(LLMs)作为连接桥梁,将 GMNER 重构为联合 MNER-VE-VG 任务。这种重构带来了两个好处:1) 它保持了最佳的 MNER 性能,消除了使用目标检测方法预先提取区域特征的需要,从而自然地解决了现有 GMNER 方法的两个主要局限性。2) 引入实体扩展表达和视觉蕴含(VE)模块统一了视觉接地(VG)和实体接地(EG)。这使得 RiVEG 能够轻松继承任何当前或未来多模态预训练模型的视觉蕴含和视觉接地能力。大量实验表明,RiVEG 在现有 GMNER 数据集上优于最先进的方法,并在所有三个子任务中分别取得了 10.65%、6.21% 和 8.83% 的绝对领先优势。

关键词

引用

@article{arxiv.2402.09989,
  title  = {LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition},
  author = {Jinyuan Li and Han Li and Di Sun and Jiahao Wang and Wenkun Zhang and Zan Wang and Gang Pan},
  journal= {arXiv preprint arXiv:2402.09989},
  year   = {2024}
}

备注

Accepted to Findings of ACL 2024