中文

知识图谱问答数据集及其泛化能力:它们足以支撑未来研究吗?

计算与语言 2022-05-16 v1 人工智能

摘要

现有的知识图谱问答(KGQA)方法泛化能力较弱,这通常归因于底层数据集的标准独立同分布(i.i.d.)假设。最近,KGQA的三种泛化层次被定义,即i.i.d.、组合式、零样本。我们针对5个不同知识图谱(KG)分析了25个知名的KGQA数据集。我们表明,根据该定义,许多现有且在线可用的KGQA数据集要么不适合训练可泛化的KGQA系统,要么基于已停用和过时的KG。生成新数据集成本高昂,因此对于较小的研究团队和公司而言并非可行替代方案。在这项工作中,我们提出了一种缓解方法,对可用的KGQA数据集进行重新划分,使其适用于评估泛化能力,且无需任何成本和人工投入。我们在三个KGQA数据集(即LC-QuAD、LC-QuAD 2.0和QALD-9)上验证了我们的假设。在重新划分的KGQA数据集上的实验证明了其朝向泛化能力的有效性。代码和以统一方式访问18个可用数据集的资源位于https://github.com/semantic-systems/KGQA-datasets以及https://github.com/semantic-systems/KGQA-datasets-generalization。

关键词

引用

@article{arxiv.2205.06573,
  title  = {Knowledge Graph Question Answering Datasets and Their Generalizability: Are They Enough for Future Research?},
  author = {Longquan Jiang and Ricardo Usbeck},
  journal= {arXiv preprint arXiv:2205.06573},
  year   = {2022}
}

备注

Accepted by SIGIR '22 (Resource Track)