从信息检索视角重新审视知识图谱补全评估
计算与语言
2022-05-16 v1 人工智能
信息检索
摘要
知识图谱补全(KGC)旨在基于知识图谱中的已知事实推断缺失的知识三元组。当前 KGC 研究大多遵循实体排序协议,通过测试三元组中掩码实体的预测排名来衡量有效性。整体性能则由所有单个答案实体的微观(平均)度量给出。由于大规模知识库固有的不完备性,这种实体排序设定很可能受到未标注的高排名正例的影响,从而引发当前评估协议是否足以保证 KGC 系统公平比较的疑问。为此,本文对标签稀疏性是否及如何影响采用流行微观度量的当前 KGC 评估进行了系统性研究。具体而言,受大规模信息检索(IR)实验的 TREC 范式启发,我们基于流行的 FB15k-237 数据集的一个样本,遵循 TREC 池化方法构建了一个相对“完备”的判断集。根据我们的分析,令人惊讶的是,从原始标签切换到我们的“完备”标签,导致 13 种流行 KGC 模型在微观度量下的系统排名发生剧烈变化。进一步研究表明,类 IR 的宏观(平均)度量在不同设定下更稳定且具有区分度,同时较少受标签稀疏性影响。因此,对于 KGC 评估,我们建议采用 TREC 风格的池化以在人类标注代价与标签完备性之间取得平衡,并同时报告类 IR 的宏观度量以反映 KGC 任务的排序本质。
引用
@article{arxiv.2205.04105,
title = {Re-thinking Knowledge Graph Completion Evaluation from an Information Retrieval Perspective},
author = {Ying Zhou and Xuanang Chen and Ben He and Zheng Ye and Le Sun},
journal= {arXiv preprint arXiv:2205.04105},
year = {2022}
}
备注
Accepted by SIGIR 2022, full paper