中文

噪声驱动的多模态知识图谱表示框架

计算与语言 2025-01-16 v4 人工智能

摘要

多模态预训练的兴起凸显了对统一多模态知识图谱 (MMKG) 表示学习框架的需求。此类框架对于将结构化知识有效嵌入多模态大型语言模型至关重要,可缓解知识误解和多模态幻觉等问题。在本工作中,我们通过两个关键任务探索了模型在 MMKG 中准确嵌入实体的有效性:多模态知识图谱补全 (MKGC) 和多模态实体对齐 (MMEA)。在此基础上,我们提出了一种新颖的 SNAG 方法,该方法利用基于 Transformer 的架构并配备模态级噪声掩码,以鲁棒地整合知识图谱中的多模态实体特征。通过结合针对 MKGC 和 MMEA 的特定训练目标,我们的方法在总共十个数据集上实现了最先进的 (SOTA) 性能,展示了其多功能性。此外,SNAG 不仅可以作为独立模型运行,还可以增强其他现有方法,提供稳定的性能提升。代码和数据可在 https://github.com/zjukg/SNAG 获取。

关键词

引用

@article{arxiv.2403.06832,
  title  = {Noise-powered Multi-modal Knowledge Graph Representation Framework},
  author = {Zhuo Chen and Yin Fang and Yichi Zhang and Lingbing Guo and Jiaoyan Chen and Jeff Z. Pan and Huajun Chen and Wen Zhang},
  journal= {arXiv preprint arXiv:2403.06832},
  year   = {2025}
}

备注

COLING 2025 Accepted, Repo is available at https://github.com/zjukg/SNAG