SPARQL 语义解析的现代基线方法
信息检索
2023-09-15 v3 计算与语言
摘要
在本工作中,我们关注从自然语言问题生成 SPARQL 查询的任务,生成的查询随后可在知识图谱(Knowledge Graphs, KGs)上执行。我们假设已提供标准实体和关系,剩余任务是将它们连同 SPARQL 词汇和输入词元按正确顺序排列,以生成正确的 SPARQL 查询。迄今为止,预训练语言模型(Pre-trained Language Models, PLMs)在此任务上尚未得到深入探索,因此我们尝试使用 BART、T5 和带有 BERT 嵌入的 PGNs(Pointer Generator Networks),在 DBpedia 和 Wikidata 知识图谱上为该任务寻找 PLM 时代的新基线。我们表明 T5 需要特殊的输入词元化,但在 LC-QuAD 1.0 和 LC-QuAD 2.0 数据集上产生了 SOTA 性能,并优于以往工作中的任务特定模型。此外,该方法能够对部分输入需要被复制到输出查询中的问题进行语义解析,从而在知识图谱语义解析中开启了一种新范式。
引用
@article{arxiv.2204.12793,
title = {Modern Baselines for SPARQL Semantic Parsing},
author = {Debayan Banerjee and Pranav Ajit Nair and Jivat Neet Kaur and Ricardo Usbeck and Chris Biemann},
journal= {arXiv preprint arXiv:2204.12793},
year = {2023}
}
备注
5 pages, short paper, SIGIR 2022