ClarQ:用于澄清问题生成的大规模多样化数据集
计算与语言
2020-06-12 v2 人工智能
机器学习
摘要
问答与对话系统常感困惑,并需要帮助澄清某些歧义。然而,现有数据集的局限性阻碍了能够生成和利用澄清问题的大规模模型的发展。为克服这些局限,我们设计了一种新颖的引导框架(基于自监督),基于从 stackexchange 提取的帖子-评论元组,辅助创建多样化、大规模的澄清问题数据集。该框架利用基于神经网络的架构对澄清问题进行分类。它是一种两步法,第一步旨在提高分类器的精确率,第二步旨在提高其召回率。我们通过将新建数据集应用于下游问答任务,定量展示了其实用性。最终数据集 ClarQ 包含约 2M 个分布于 stackexchange 173 个领域的样例。我们发布该数据集以推动澄清问题生成领域的研究,并最终旨在增强对话与问答系统。
引用
@article{arxiv.2006.05986,
title = {ClarQ: A large-scale and diverse dataset for Clarification Question Generation},
author = {Vaibhav Kumar and Alan W. black},
journal= {arXiv preprint arXiv:2006.05986},
year = {2020}
}
备注
Accepted at ACL 2020