中文

良好的视觉引导造就更优抽取器:面向多模态实体与关系抽取的分层视觉前缀

计算与语言 2022-12-01 v1 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

多模态命名实体识别与关系抽取(MNER 与 MRE)是信息抽取中基础且关键的支脉。然而,现有的 MNER 与 MRE 方法在文本中混入无关物体图像时通常存在错误敏感性。为应对这些问题,我们提出一种新颖的分层视觉前缀融合网络(Hierarchical Visual Prefix fusion NeTwork, HVPNeT),用于视觉增强的实体与关系抽取,旨在实现更有效且鲁棒的性能。具体而言,我们将视觉表示视为可插拔的视觉前缀,以引导文本表示做出对错误不敏感的预测决策。我们进一步提出动态门控聚合策略,以实现分层多尺度视觉特征作为视觉前缀进行融合。在三个基准数据集上的大量实验证明了我们方法的有效性,并取得了最先进(state-of-the-art)性能。代码见 https://github.com/zjunlp/HVPNeT。

关键词

引用

@article{arxiv.2205.03521,
  title  = {Good Visual Guidance Makes A Better Extractor: Hierarchical Visual Prefix for Multimodal Entity and Relation Extraction},
  author = {Xiang Chen and Ningyu Zhang and Lei Li and Yunzhi Yao and Shumin Deng and Chuanqi Tan and Fei Huang and Luo Si and Huajun Chen},
  journal= {arXiv preprint arXiv:2205.03521},
  year   = {2022}
}

备注

Accepted by NAACL 2022