基于 Transformer 的多模态知识图谱补全与链接感知上下文
计算与语言
2025-09-16 v2 人工智能
机器学习
摘要
多模态知识图谱补全(MMKGC)旨在通过利用结构数据之外的各种模态信息,预测多模态知识图谱(MMKG)中缺失的链接。现有的 MMKGC 方法主要扩展传统的知识图谱嵌入(KGE)模型,这些模型通常需要为每个实体创建嵌入向量,导致模型规模大且在整合多模态信息时效率低下,尤其是对于现实世界的图谱。而基于 Transformer 的模型在知识图谱补全(KGC)中展现出竞争性能,但其关注单模态知识,限制了跨模态信息的利用能力。最近,大型视觉语言模型(VLM)在跨模态任务中展现出潜力,但受限于高昂的训练成本。本文提出一种新方法,将基于 Transformer 的 KGE 模型与由预训练 VLM 生成的跨模态上下文相结合,从而将其适用于 MMKGC。具体而言,我们采用预训练 VLM 将实体及其邻居的相关视觉信息转化为文本序列,然后将 KGC 问题定义为序列到序列任务,利用生成的跨模态上下文进行微调。这种简单而有效的方法在模型规模上显著优于传统 KGE 方法,同时在多个大规模数据集上实现了竞争性能,且对超参数调优要求极低。
引用
@article{arxiv.2501.15688,
title = {Transformer-Based Multimodal Knowledge Graph Completion with Link-Aware Contexts},
author = {Haodi Ma and Dzmitry Kasinets and Daisy Zhe Wang},
journal= {arXiv preprint arXiv:2501.15688},
year = {2025}
}