中文

用于对话解缠的大规模语料库

计算与语言 2020-06-05 v2

摘要

将混合在单一消息流中的对话解缠是一项困难的任务,而大型人工标注数据集的缺乏使其更加困难。我们创建了一个包含 77,563 条消息的新数据集,这些消息经人工标注了回复结构图,既可解缠对话又可定义对话内部结构。我们的数据集比此前发布的所有数据集总和大 16 倍,是首个包含标注分歧裁决的数据集,也是首个包含上下文的数据集。我们利用数据重新考察了先前工作,特别发现广泛使用的对话语料库中 80% 的对话要么缺失消息要么包含多余消息。我们的人工标注数据为开发鲁棒的数据驱动对话解缠方法提供了机会,这将有助于推进对话研究。

关键词

引用

@article{arxiv.1810.11118,
  title  = {A Large-Scale Corpus for Conversation Disentanglement},
  author = {Jonathan K. Kummerfeld and Sai R. Gouravajhala and Joseph Peper and Vignesh Athreya and Chulaka Gunasekara and Jatin Ganhotra and Siva Sankalp Patel and Lazaros Polymenakos and Walter S. Lasecki},
  journal= {arXiv preprint arXiv:1810.11118},
  year   = {2020}
}

备注

To appear at ACL