知识图谱问答排行榜:防止可复现性危机的社区资源
计算与语言
2022-01-21 v1 人工智能
信息检索
摘要
数据驱动系统需要被评估以建立对科学方法及其适用性的信任。对于知识图谱(KG)问答(QA)而言尤其如此,该任务通过自然语言接口访问复杂的数据结构。十余年来,评估这些系统的能力一直是社区发展的驱动力,并建立了不同的KGQA基准数据集。然而,比较不同方法十分繁琐。缺乏现有且经过整理的领导板导致对该研究领域缺乏全局视野,并可能使人对结果产生不信任。特别是KGQA社区中最新且最常用的数据集LC-QuAD和QALD,未能提供集中且最新的信任节点。本文中,我们调查并分析了广泛的评估结果,显著覆盖了过去十年的100篇出版物和98个系统。我们为任意KGQA基准数据集提供了一个新的集中且开放的领导板作为社区的聚焦点——https://kgqa.github.io/leaderboard。我们的分析凸显了KGQA系统评估过程中存在的问题,从而指出未来评估可能的改进方向。
引用
@article{arxiv.2201.08174,
title = {Knowledge Graph Question Answering Leaderboard: A Community Resource to Prevent a Replication Crisis},
author = {Aleksandr Perevalov and Xi Yan and Liubov Kovriguina and Longquan Jiang and Andreas Both and Ricardo Usbeck},
journal= {arXiv preprint arXiv:2201.08174},
year = {2022}
}