KGConv:一个基于 Wikidata 的对话语料库
计算与语言
2023-08-30 v1 人工智能
摘要
我们提出 KGConv,一个包含 71k 段对话的大规模对话语料库,其中每个问答对都基于一条 Wikidata 事实。对话平均包含 8.6 个问题,并且对于每个 Wikidata 事实,我们利用模板、人工标注、手工规则和问答重写神经模型提供其对应问题的多个变体(平均 12 个)。我们为基于知识的对话式问题生成任务提供了基线。KGConv 还可进一步用于其他生成与分析任务,例如从 Wikidata 三元组生成单轮问题、问题重写、基于对话或知识图谱的问答以及测验生成。
引用
@article{arxiv.2308.15298,
title = {KGConv, a Conversational Corpus grounded in Wikidata},
author = {Quentin Brabant and Gwenole Lecorve and Lina M. Rojas-Barahona and Claire Gardent},
journal= {arXiv preprint arXiv:2308.15298},
year = {2023}
}