中文

基于Wikidata的中文多类型复杂问答数据集

计算与语言 2021-11-12 v1 人工智能 数据库

摘要

复杂知识库问答在过去十年中是热门研究领域。近期的公开数据集在该领域取得了令人鼓舞的成果,但大多局限于英语且仅涉及少量问题类型和关系,阻碍了更真实场景及非英语语言下的研究。此外,少数最先进的KBQA模型在最为流行的真实知识库之一Wikidata上训练。我们提出CLC-QuAD,这是首个大规模基于Wikidata的中文复杂语义解析数据集,以应对这些挑战。除数据集外,我们给出一个文本到SPARQL的基线模型,该模型能以Wikidata为背景知识有效回答多类型复杂问题,如事实型问题、双意图问题、布尔问题和计数问题。我们最后分析了SOTA KBQA模型在该数据集上的表现,并指出了中文KBQA面临的挑战。

关键词

引用

@article{arxiv.2111.06086,
  title  = {A Chinese Multi-type Complex Questions Answering Dataset over Wikidata},
  author = {Jianyun Zou and Min Yang and Lichao Zhang and Yechen Xu and Qifan Pan and Fengqing Jiang and Ran Qin and Shushu Wang and Yifan He and Songfang Huang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2111.06086},
  year   = {2021}
}

备注

8 pages