中文

用于多模态知识图谱补全的带多级融合的混合 Transformer

计算与语言 2023-09-19 v5 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

多模态知识图谱(MKG)组织视觉-文本事实知识,近来已成功应用于信息检索、问答和推荐系统等任务。由于大多数 MKG 远未完备,已有大量知识图谱补全研究提出,聚焦于多模态实体、关系抽取和链接预测。然而,不同任务和模态要求改变模型架构,且并非所有图像/对象都与文本输入相关,这阻碍了对多样真实场景的适用性。本文中,我们提出一种带多级融合的混合 Transformer 以解决这些问题。具体而言,我们利用具有统一输入输出架构的混合 Transformer 来处理多样的多模态知识图谱补全任务。此外,我们提出多级融合,通过粗粒度前缀引导交互与细粒度相关性感知融合模块来整合视觉与文本表示。我们进行了大量实验验证我们的 MKGformer 能在多模态链接预测、多模态关系抽取(RE)和多模态命名实体识别(NER)的四个数据集上取得 SOTA 性能。代码见 https://github.com/zjunlp/MKGformer。

关键词

引用

@article{arxiv.2205.02357,
  title  = {Hybrid Transformer with Multi-level Fusion for Multimodal Knowledge Graph Completion},
  author = {Xiang Chen and Ningyu Zhang and Lei Li and Shumin Deng and Chuanqi Tan and Changliang Xu and Fei Huang and Luo Si and Huajun Chen},
  journal= {arXiv preprint arXiv:2205.02357},
  year   = {2023}
}

备注

Accepted by SIGIR 2022. Fix a severe bug