中文

NarraSum:一个用于抽象式叙事摘要的大规模数据集

计算与语言 2023-06-29 v2

摘要

叙事摘要旨在生成叙事的精简版本,以描述其最显著的事件和人物。对叙事进行摘要具有挑战性,因为这需要理解事件因果关系和人物行为。为鼓励该方向的研究,我们提出了 NarraSum,一个大规模叙事摘要数据集。它包含 122K 篇叙事文档,这些文档收集自具有多样类型的电影和电视剧集的情节描述,以及它们对应的抽象式摘要。实验表明,在 NarraSum 上,人类与最先进的摘要模型之间存在很大的性能差距。我们希望该数据集能推动未来的摘要研究,以及更广泛的自然语言理解与生成研究。数据集可在 https://github.com/zhaochaocs/narrasum 获取。

关键词

引用

@article{arxiv.2212.01476,
  title  = {NarraSum: A Large-Scale Dataset for Abstractive Narrative Summarization},
  author = {Chao Zhao and Faeze Brahman and Kaiqiang Song and Wenlin Yao and Dian Yu and Snigdha Chaturvedi},
  journal= {arXiv preprint arXiv:2212.01476},
  year   = {2023}
}

备注

EMNLP Findings 2022