AQuaMuSe:自动生成基于查询的多文档摘要数据集
计算与语言
2020-10-27 v1
摘要
摘要任务是将源文档压缩为连贯且简洁的段落。这是向用户呈现与其查询相关的排名靠前文档的简明准确概览的有用工具。基于查询的多文档摘要(qMDS)满足了这一普遍需求,但由于缺乏训练和评测数据集,研究受到严重限制,因为现有的单文档与多文档摘要数据集在形式和规模上均不充分。我们提出一种称为AQuaMuSe的可扩展方法,用于从问答数据集和大型文档语料库中自动挖掘qMDS样例。我们的方法独特之处在于可生成一个双重数据集——同时用于抽取式与生成式摘要。我们公开发布了一个AQuaMuSe数据集的具体实例,含5,519个基于查询的摘要,每个摘要关联平均从Common Crawl的3.55亿文档索引中选取的6个输入文档。提供了该数据集的广泛评测及基线摘要模型实验。
引用
@article{arxiv.2010.12694,
title = {AQuaMuSe: Automatically Generating Datasets for Query-Based Multi-Document Summarization},
author = {Sayali Kulkarni and Sheide Chammas and Wan Zhu and Fei Sha and Eugene Ie},
journal= {arXiv preprint arXiv:2010.12694},
year = {2020}
}