一个持续增长的句子级复述数据集
计算与语言
2017-08-02 v1
摘要
复述研究面临的一个主要挑战是缺乏平行语料库。在本文中,我们提出了一种新方法,通过共享 URL 链接推文,从 Twitter 收集大规模句子级复述。该方法的主要优势在于其简单性,因为它摒弃了先前工作中在标注前选择数据以及随后应用复述识别算法时所需的分类器或人工介入。我们提供了迄今为止最大规模的包含 51,524 个句子对的人工标注复述语料库,以及首个面向自动复述识别的跨领域基准测试。此外,我们展示了每月可以约 70% 的精度轻松且持续地捕获超过 30,000 个新的句子级复述,并通过短语复述提取证明了它们对下游 NLP 任务的实用性。我们已将代码和数据免费公开。
引用
@article{arxiv.1708.00391,
title = {A Continuously Growing Dataset of Sentential Paraphrases},
author = {Wuwei Lan and Siyu Qiu and Hua He and Wei Xu},
journal= {arXiv preprint arXiv:1708.00391},
year = {2017}
}
备注
11 pages, accepted to EMNLP 2017