良好的视觉引导造就更优抽取器:面向多模态实体与关系抽取的分层视觉前缀
计算与语言
2022-12-01 v1 人工智能
计算机视觉与模式识别
机器学习
多媒体
摘要
多模态命名实体识别与关系抽取(MNER 与 MRE)是信息抽取中基础且关键的支脉。然而,现有的 MNER 与 MRE 方法在文本中混入无关物体图像时通常存在错误敏感性。为应对这些问题,我们提出一种新颖的分层视觉前缀融合网络(Hierarchical Visual Prefix fusion NeTwork, HVPNeT),用于视觉增强的实体与关系抽取,旨在实现更有效且鲁棒的性能。具体而言,我们将视觉表示视为可插拔的视觉前缀,以引导文本表示做出对错误不敏感的预测决策。我们进一步提出动态门控聚合策略,以实现分层多尺度视觉特征作为视觉前缀进行融合。在三个基准数据集上的大量实验证明了我们方法的有效性,并取得了最先进(state-of-the-art)性能。代码见 https://github.com/zjunlp/HVPNeT。
引用
@article{arxiv.2205.03521,
title = {Good Visual Guidance Makes A Better Extractor: Hierarchical Visual Prefix for Multimodal Entity and Relation Extraction},
author = {Xiang Chen and Ningyu Zhang and Lei Li and Yunzhi Yao and Shumin Deng and Chuanqi Tan and Fei Huang and Luo Si and Huajun Chen},
journal= {arXiv preprint arXiv:2205.03521},
year = {2022}
}
备注
Accepted by NAACL 2022