中文

知识图谱问答排行榜:防止可复现性危机的社区资源

计算与语言 2022-01-21 v1 人工智能 信息检索

摘要

数据驱动系统需要被评估以建立对科学方法及其适用性的信任。对于知识图谱(KG)问答(QA)而言尤其如此,该任务通过自然语言接口访问复杂的数据结构。十余年来,评估这些系统的能力一直是社区发展的驱动力,并建立了不同的KGQA基准数据集。然而,比较不同方法十分繁琐。缺乏现有且经过整理的领导板导致对该研究领域缺乏全局视野,并可能使人对结果产生不信任。特别是KGQA社区中最新且最常用的数据集LC-QuAD和QALD,未能提供集中且最新的信任节点。本文中,我们调查并分析了广泛的评估结果,显著覆盖了过去十年的100篇出版物和98个系统。我们为任意KGQA基准数据集提供了一个新的集中且开放的领导板作为社区的聚焦点——https://kgqa.github.io/leaderboard。我们的分析凸显了KGQA系统评估过程中存在的问题,从而指出未来评估可能的改进方向。

关键词

引用

@article{arxiv.2201.08174,
  title  = {Knowledge Graph Question Answering Leaderboard: A Community Resource to Prevent a Replication Crisis},
  author = {Aleksandr Perevalov and Xi Yan and Liubov Kovriguina and Longquan Jiang and Andreas Both and Ricardo Usbeck},
  journal= {arXiv preprint arXiv:2201.08174},
  year   = {2022}
}