COMBO:面向开放知识图谱规范化的完整基准
计算与语言
2023-02-09 v1 人工智能
摘要
开放知识图谱(KG)由从数百万原始文本中抽取的(主语、关系、宾语)三元组构成。开放KG中的主语和宾语名词短语以及关系存在严重的冗余与歧义,需要被规范化。现有的开放KG规范化数据集仅为主语名词短语提供金标准实体级规范化。在本文中,我们提出COMBO,一个面向开放KG规范化的完整基准。与现有数据集相比,我们额外提供了关系短语的金标准规范化、名词短语的金标准本体级规范化,以及抽取三元组所源自的源句子。我们还提出了用于评估每类规范化的指标。在COMBO数据集上,我们实证比较了先前提出的规范化方法以及若干基于预训练语言模型的简单基线方法。我们发现,使用预训练语言模型对三元组中的短语进行恰当编码可带来更好的关系规范化和名词短语的本体级规范化。我们在 https://github.com/jeffchy/COMBO/tree/main 发布了我们的数据集、基线与评估脚本。
引用
@article{arxiv.2302.03905,
title = {COMBO: A Complete Benchmark for Open KG Canonicalization},
author = {Chengyue Jiang and Yong Jiang and Weiqi Wu and Yuting Zheng and Pengjun Xie and Kewei Tu},
journal= {arXiv preprint arXiv:2302.03905},
year = {2023}
}
备注
18 pages