致力于更好的归纳式知识图谱补全基准数据集
人工智能
2025-06-26 v3 机器学习
摘要
知识图谱补全(KGC)旨在预测知识图谱(KG)中缺失的事实。最近,人们越来越关注设计能够在归纳设置下取得佳绩的KGC方法,即推理中看到的部分或全部实体和关系在训练期间都是未观察到的。为归纳式KGC提出了众多基准数据集,所有数据集都源自用于传递式KGC的现有KG的子集。然而,我们发现构建归纳式KGC数据集的当前程序无意中创建了一个可以在不考虑关系信息的情况下被利用的捷径。具体而言,我们观察到个人化PageRank(PPR)得分在大多数数据集上能够取得强或接近最佳性能。在本文中,我们研究了这个问题的根本原因。借助这些见解,我们提出了一种用于构建归纳式KGC数据集的替代策略,以缓解PPR捷径。我们随后对多种流行方法进行基准测试,并分析其性能。新的基准数据集有助于通过消除掩盖性能的捷径,促进对归纳式KGC能力和挑战的更好理解。代码、数据集可在 https://github.com/HarryShomer/Better-Inductive-KGC 查找。
关键词
引用
@article{arxiv.2406.11898,
title = {Towards Better Benchmark Datasets for Inductive Knowledge Graph Completion},
author = {Harry Shomer and Jay Revolinsky and Jiliang Tang},
journal= {arXiv preprint arXiv:2406.11898},
year = {2025}
}
备注
KDD'25 Datasets & Benchmark Track