链接预测中的数值文字:对模型与数据集的批判性检视
机器学习
2024-07-26 v1 数据库
摘要
链接预测(LP) 是知识图谱(KGs)上的一个关键任务,传统上侧重于使用和预测实体之间的关系。虽然文本实体描述已被证明具有价值,但包含数值文字的模型在现有基准数据集上仅显示出轻微的改进。尚不清楚的是,模型实际上是否在更好地利用数值文字,还是更擅长利用图结构。这引发了对这些方法以及现有基准数据集适用性的疑问。我们提出了一种方法,用于评估包含数值文字的 LP 模型。我们提出 i) 一种新的合成数据集以更好地理解这些模型如何有效使用数值文字,ii) 数据集剖析策略以调查现有数据集可能的困难。我们识别出一种普遍趋势:许多模型未充分利用文字信息,可能依赖于额外的参数来获得性能提升。我们的调查强调在发布新模型和数据集时需要更广泛的评估。
引用
@article{arxiv.2407.18241,
title = {Numerical Literals in Link Prediction: A Critical Examination of Models and Datasets},
author = {Moritz Blum and Basil Ell and Hannes Ill and Philipp Cimiano},
journal= {arXiv preprint arXiv:2407.18241},
year = {2024}
}