中文

Molweni:一个具有话语结构的基于多方对话的机器阅读理解挑战性数据集

计算与语言 2020-11-10 v3

摘要

近年来,多方对话领域的研究显著增长。我们提出 Molweni 数据集,一个构建于多方对话之上、带有话语结构的机器阅读理解(MRC)数据集。Molweni 的源样本取自 Ubuntu Chat Corpus,包含 10,000 段对话,共计 88,303 条话语。我们对该语料标注了 30,066 个问题,包括可回答与不可回答问题。Molweni 还独特地以修改后的分段话语表征理论(SDRT; Asher 等,2016)风格为所有多方对话贡献了话语依存标注,为多方对话话语解析任务提供了大规模(78,245 个标注话语关系)数据。我们的实验表明 Molweni 对当前 MRC 模型是一个具挑战性的数据集:BERT-wwm(当前 SQuAD 2.0 的强性能模型)在 Molweni 问题上仅取得 67.7% 的 F1,相较其 SQuAD 2.0 性能显著下降 20% 以上。

关键词

引用

@article{arxiv.2004.05080,
  title  = {Molweni: A Challenge Multiparty Dialogues-based Machine Reading Comprehension Dataset with Discourse Structure},
  author = {Jiaqi Li and Ming Liu and Min-Yen Kan and Zihao Zheng and Zekun Wang and Wenqiang Lei and Ting Liu and Bing Qin},
  journal= {arXiv preprint arXiv:2004.05080},
  year   = {2020}
}

备注

Accepted by COLING 2020, long Paper