面向抽象式查询聚焦多文档摘要的数据增强
计算与语言
2021-03-03 v1 人工智能
摘要
查询聚焦多文档摘要(QMDS)的进展一直受限于缺乏足够的大规模高质量训练数据集。我们提出了两个 QMDS 训练数据集,采用两种数据增强方法构建:(1)迁移常用的单文档 CNN/Daily Mail 摘要数据集以创建 QMDSCNN 数据集;(2)挖掘搜索查询日志以创建 QMDSIR 数据集。这两个数据集具有互补特性,即 QMDSCNN 具有真实摘要但查询为模拟生成,而 QMDSIR 具有真实查询但摘要为模拟生成。为同时覆盖真实摘要与真实查询两方面,我们在合并数据集上构建了抽象式端到端神经网络模型,在 DUC 数据集上取得了新的最先进迁移结果。我们还引入了新的分层编码器,能够更高效地对查询与多文档进行联合编码。实证结果表明,我们的数据增强与编码方法在自动指标以及沿多个属性的人工评估上均优于基线模型。
引用
@article{arxiv.2103.01863,
title = {Data Augmentation for Abstractive Query-Focused Multi-Document Summarization},
author = {Ramakanth Pasunuru and Asli Celikyilmaz and Michel Galley and Chenyan Xiong and Yizhe Zhang and Mohit Bansal and Jianfeng Gao},
journal= {arXiv preprint arXiv:2103.01863},
year = {2021}
}
备注
AAAI 2021 (13 pages)