中文

PeCoQ:一个面向波斯语知识图谱复杂问答的数据集

计算与语言 2021-06-29 v1 人工智能

摘要

问答系统可从非结构化文本或知识图谱等结构化数据中找到用户问题的答案。使用包括深度学习模型在内的监督学习方法回答问题需要大型训练数据集。近年来,一些面向知识图谱问答任务的数据集被提出,这也是本文的关注点。尽管已提出许多英文数据集,波斯语问答数据集却很少。本文介绍PeCoQ,一个波斯语问答数据集。该数据集包含从波斯语知识图谱FarsBase中抽取的10,000个复杂问题与答案。每个问题还提供了由语言学家撰写的SPARQL查询及两个改写句。数据集中存在多种复杂类型,如多关系、多实体、序数和时序约束。本文讨论了数据集特征并描述了构建方法。

关键词

引用

@article{arxiv.2106.14167,
  title  = {PeCoQ: A Dataset for Persian Complex Question Answering over Knowledge Graph},
  author = {Romina Etezadi and Mehrnoush Shamsfard},
  journal= {arXiv preprint arXiv:2106.14167},
  year   = {2021}
}

备注

5 pages, 4 figures