中文

CBench:面向知识图谱问答的更优评测

计算与语言 2021-05-04 v1

摘要

近来,仅可由专家查询的知识图谱数量不断增加。然而,使用结构化查询描述问题对非专家用户而言并不直观,他们需要充分了解所查询知识图谱的词汇与结构,以及用于描述用户信息需求的结构化查询语言语法。为克服上述挑战,最流行的方案是使用自然语言查询这些知识图谱。尽管已有若干问答基准可用于评估多个流行知识图谱上的问答系统,但选取一个能准确评判问答系统质量的基准仍是一项艰巨任务。本文介绍 CBench,一个可扩展且信息更丰富的基准测试套件,用于分析基准并评估问答系统。CBench 可依据基准中问题与查询的若干细粒度语言、句法与结构属性分析现有基准。我们表明现有基准在这些属性上差异显著,致使选取其中一小部分来评测 QA 系统并不可靠。在进一步研究提升基准质量与全面性之前,CBench 可借助一组流行基准(并可增补用户提供的其他基准)来促进该评估。CBench 不仅基于流行的单值指标评估问答系统,还针对已答与未答问题的语言、句法和结构属性给出详细分析,以更好地帮助问答系统开发者了解其系统优势与不足。

关键词

引用

@article{arxiv.2105.00811,
  title  = {CBench: Towards Better Evaluation of Question Answering Over Knowledge Graphs},
  author = {Abdelghny Orogat and Isabelle Liu and Ahmed El-Roby},
  journal= {arXiv preprint arXiv:2105.00811},
  year   = {2021}
}