中文

MovieSum:用于电影剧本的抽象摘要数据集

计算与语言 2024-08-13 v1 人工智能

摘要

电影剧本摘要具有挑战性,因为其需要理解长时间的输入上下文以及电影特有的各种元素。大型语言模型在文档摘要方面取得了显著进展,但常常在处理长输入上下文方面存在困难。尽管近期研究关注电视台记谱,但电影剧本摘要仍属探索不足的领域。为刺激该领域的研究,我们提出一个新数据集MovieSum,用于电影剧本的抽象摘要。该数据集包含2200部电影剧本及其维基百科情节摘要。我们手动格式化电影剧本以表示其结构元素。与现有数据集相比,MovieSum具有以下几个独特特征:(1) 包括电影剧本,内容长于电视剧本;(2) 规模是现有电影剧本数据集的两倍;(3) 提供带有IMDb ID的元数据,以便访问额外的外部知识。我们还展示了最近发布的大型语言模型在本数据集上进行摘要的效果,以提供详细的基线。

关键词

引用

@article{arxiv.2408.06281,
  title  = {MovieSum: An Abstractive Summarization Dataset for Movie Screenplays},
  author = {Rohit Saxena and Frank Keller},
  journal= {arXiv preprint arXiv:2408.06281},
  year   = {2024}
}

备注

ACL 2024 Findings