中文

分词、融合与增强:面向细粒度多模态实体表示

人工智能 2024-12-17 v2

摘要

多模态知识图谱补全旨在从给定的知识图谱中发现未观测到的知识,协同利用三元组的结构信息和实体的多模态信息来克服其固有的不完整性。现有的 MMKGC 方法通常使用预训练模型提取多模态特征,导致对多模态实体信息的处理较为粗糙,忽略了细微的细粒度语义细节及其复杂的相互作用。为了解决这一缺陷,我们引入了一个新颖的框架 MyGO,以对实体的细粒度多模态表示进行分词、融合和增强,从而提升 MMKGC 性能。受分词技术启发,MyGO 将多模态实体信息分词为细粒度的离散 token,并通过跨模态实体编码器学习实体表示。为了进一步增强多模态表示,MyGO 引入了细粒度对比学习以突出实体表示的特异性。在标准 MMKGC 基准上的实验表明,我们的方法超越了 19 个最新模型,凸显了其卓越的性能。代码和数据可在 https://github.com/zjukg/MyGO 找到。

关键词

引用

@article{arxiv.2404.09468,
  title  = {Tokenization, Fusion, and Augmentation: Towards Fine-grained Multi-modal Entity Representation},
  author = {Yichi Zhang and Zhuo Chen and Lingbing Guo and Yajing Xu and Binbin Hu and Ziqi Liu and Wen Zhang and Huajun Chen},
  journal= {arXiv preprint arXiv:2404.09468},
  year   = {2024}
}

备注

AAAI 2025; Repo is available at https://github.com/zjukg/MyGO