用于多模态关系提取的双门控融合与前缀微调方法
计算与语言
2023-06-21 v1
摘要
多模态关系提取(MMRE)旨在识别含有视觉线索的文本中两个实体之间的关系。丰富的视觉内容对 MMRE 任务很有价值,但现有工作不能很好地建模不同模态间更细粒度的关联,无法捕获真正有用的视觉信息,从而限制了关系提取性能。在本文中,我们提出了一种新颖的 MMRE 框架,以更好地捕获文本、实体对和图像/物体之间更深层的关联,从而为任务挖掘更有用的信息,称为 DGF-PT。我们首先提出一种基于提示的自回归编码器,分别通过面向实体和面向物体的前缀构建任务相关的模态内与模态间特征关联。为了更好地整合有用的视觉信息,我们设计了一个双门控融合模块来区分图像/物体的重要性并进一步丰富文本表示。此外,引入了一个带有实体类型对关系约束的生成式解码器,更好地过滤候选。在基准数据集上进行的大量实验表明,即便在少样本情形下,我们的方法相比强劲的竞争对手也取得了优异的性能。
引用
@article{arxiv.2306.11020,
title = {Dual-Gated Fusion with Prefix-Tuning for Multi-Modal Relation Extraction},
author = {Qian Li and Shu Guo and Cheng Ji and Xutan Peng and Shiyao Cui and Jianxin Li},
journal= {arXiv preprint arXiv:2306.11020},
year = {2023}
}