中文

基于混合视觉证据的少样本关系抽取

计算与语言 2024-03-04 v1 计算机视觉与模式识别

摘要

少样本关系抽取的目标是当仅有少量标记实例用于训练时,从句子中预测名称实体之间的关系。现有的少样本关系抽取方法关注单模态信息,如仅依赖文本。这会降低当名称实体在文本中未呈现明确上下文时的性能。我们提出了一种多模态少样本关系抽取模型(MFS-HVE),利用文本和视觉语义信息共同学习多模态表示。MFS-HVE 包括语义特征提取器和多模态融合组件。MFS-HVE 语义特征提取器用于提取文本特征和视觉特征,其中视觉特征包括全局图像特征和图像中局部目标特征。MFS-HVE 多模态融合单元通过图像引导注意力、目标引导注意力和混合特征注意力等方式整合来自各种模态的信息,以充分捕获视觉图像区域与相关文本之间的语义互动。在两个公开数据集上进行的大量实验表明,语义视觉信息显著提高了少样本关系预测的性能。

关键词

引用

@article{arxiv.2403.00724,
  title  = {Few-Shot Relation Extraction with Hybrid Visual Evidence},
  author = {Jiaying Gong and Hoda Eldardiry},
  journal= {arXiv preprint arXiv:2403.00724},
  year   = {2024}
}

备注

16 pages, 5 figures