中文

DiffusionCom:面向多模态知识图谱补全的结构感知多模态扩散模型

信息检索 2025-04-10 v1

摘要

当前大多数知识图谱补全(MKGC)方法基于判别模型,最大化条件似然函数,难以有效捕捉现实知识图谱中复杂的关联,从而限制整体性能。为此,我们提出一种结构感知多模态扩散模型用于知识图谱补全(DiffusionCom)。DiffusionCom 创新地从生成模型的角度出发,将 (head,relation)(head, relation) 配对与候选尾实体之间的关联建模为其联合概率分布 p((head,relation),(tail))p((head, relation), (tail)),将 MKGC 任务定义为从噪声逐步生成联合概率分布的过程。进一步,为了充分利用 MKG 中的结构信息,我们提出 Structure-MKGformer 作为 DiffusionCom 的编码器。Structure-MKGformer 通过多模态图注意力网络(MGAT)捕获丰富的结构信息,并自适应地与实体表示融合,从而增强了这些表示的结构感知能力。该设计有效地解决了现有 MKGC 方法,尤其是基于多模态预训练模型的方法,在利用结构信息方面的局限性。DiffusionCom 采用生成与判别损失共同训练生成器,而特征提取器仅使用判别损失优化。这种双重方法使 DiffusionCom 能够发挥生成模型和判别模型的优势。在 FB15k-237-IMG 和 WN18-IMG 数据集上的大量实验表明,DiffusionCom 在状态机模型方面显著优于现有方法。

关键词

引用

@article{arxiv.2504.06543,
  title  = {DiffusionCom: Structure-Aware Multimodal Diffusion Model for Multimodal Knowledge Graph Completion},
  author = {Wei Huang and Meiyu Liang and Peining Li and Xu Hou and Yawen Li and Junping Du and Zhe Xue and Zeli Guan},
  journal= {arXiv preprint arXiv:2504.06543},
  year   = {2025}
}

备注

11 pages, 6 figures