链接预测中的词汇表外实体
机器学习
2021-05-27 v1 社会与信息网络
摘要
知识图谱嵌入技术是为大量基于向量表示的机器学习方法铺平道路的关键。链接预测常被用作评估这些嵌入质量的代理指标。鉴于构建链接预测基准耗时费力,该主题多数工作仅使用少量基准。由于基准对算法公平比较至关重要,确保其质量等同于为开发更优的链接预测及随之而来的知识图谱嵌入方案提供坚实基础。对基准的初步研究指出了若干基准数据集从开发片段到测试片段的信息泄漏局限。我们发现了常用于评估链接预测方法的三个基准的进一步共性局限:测试集与验证集中的词汇表外实体。我们给出了一种识别并移除此类实体的方法实现,并提供了 WN18RR、FB15K-237 与 YAGO3-10 数据集的修正版本。在修正版 WN18RR、FB15K-237 与 YAGO3-10 上的实验表明,最先进方法的测得性能发生显著改变,p 值分别小于 1%、小于 1.4% 与小于 1%。总体而言,最先进方法在 WN18RR 所有指标上平均绝对提升 。这意味着先前工作中的部分结论可能需要重新审视。我们在 https://github.com/dice-group/OOV-In-Link-Prediction 提供了实验与修正数据集的开源实现。
引用
@article{arxiv.2105.12524,
title = {Out-of-Vocabulary Entities in Link Prediction},
author = {Caglar Demir and Axel-Cyrille Ngonga Ngomo},
journal= {arXiv preprint arXiv:2105.12524},
year = {2021}
}