中文

WDV:一个基于 Wikidata 构建的广义数据 verbalisation 数据集

计算与语言 2022-05-06 v1

摘要

数据 verbalisation 在当前自然语言处理领域中是一项极为重要的任务,因为将我们丰富的结构化和半结构化数据转换为人类可读的格式具有巨大益处。知识图谱(KG)数据 verbalisation 侧重于将主体、谓词和客体构成的三元组式互联声明转换为文本。尽管某些 KG 已有 verbalisation 数据集,但在许多场景下的适用性仍存在不足。对于 Wikidata 而言尤为如此,现有数据集要么松散地将声明集与文本信息耦合,要么严重聚焦于传记、城市和国家相关的谓词。为弥补这些不足,我们提出 WDV,一个基于 Wikidata 构建的大型 KG 声明 verbalisation 数据集,其在三元组与文本间具有紧密耦合,并涵盖广泛的实体与谓词。我们还通过一套可复用的流程来评估 verbalisation 质量,该流程用于衡量以人为中心的流畅度与充分性得分。我们的数据与代码均已开放获取,以期推动 KG verbalisation 相关研究。

关键词

引用

@article{arxiv.2205.02627,
  title  = {WDV: A Broad Data Verbalisation Dataset Built from Wikidata},
  author = {Gabriel Amaral and Odinaldo Rodrigues and Elena Simperl},
  journal= {arXiv preprint arXiv:2205.02627},
  year   = {2022}
}