中文

BIGPATENT:用于抽象式与连贯摘要的大规模数据集

计算与语言 2019-06-11 v1 机器学习

摘要

大多数现有的文本摘要数据集编译自新闻领域,其中的摘要具有扁平化的语篇结构。在此类数据集中,值得摘要的内容常出现在输入文章的开头。此外,输入文章的大段内容逐字出现在各自对应的摘要中。这些问题阻碍了能够理解文章全局内容结构、并生成高压缩率抽象式摘要的系统的学习与评估。在本工作中,我们提出一个新颖的数据集 BIGPATENT,包含 130 万条美国专利文档记录及人工撰写的抽象式摘要。与现有摘要数据集相比,BIGPATENT 具有以下特性:i) 摘要包含更丰富的语篇结构及更多重复出现的实体;ii) 显著内容在输入中均匀分布;iii) 摘要中包含的抽取式片段更少且更短。最后,我们在 BIGPATENT 上训练并评估了基线模型与流行的学习模型,以揭示新的挑战并为摘要研究的未来方向提供动机。

关键词

引用

@article{arxiv.1906.03741,
  title  = {BIGPATENT: A Large-Scale Dataset for Abstractive and Coherent Summarization},
  author = {Eva Sharma and Chen Li and Lu Wang},
  journal= {arXiv preprint arXiv:1906.03741},
  year   = {2019}
}

备注

Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. ACL 2019 (10 pages)