将维基百科转化为用于查询聚焦摘要的增强数据
计算与语言
2022-07-25 v2
摘要
现有查询聚焦摘要数据集规模有限,使得训练数据驱动的摘要模型颇具挑战。同时,人工构建查询聚焦摘要语料库成本高且耗时。在本文中,我们利用维基百科自动收集了一个包含超过280,000个样本的查询聚焦摘要数据集(命名为WIKIREF),可作为数据增强的一种手段。我们还开发了一个基于BERT的查询聚焦摘要模型(Q-BERT)以从文档中抽取句子作为摘要。为了更好地使包含数百万参数的庞大模型适配微小基准,我们识别并仅微调一个稀疏子网络,其对应于整体模型参数的很小一部分。在三个DUC基准上的实验结果表明,在WIKIREF上预训练的模型已取得合理性能。在特定基准数据集上微调后,带数据增强的模型优于强对比系统。此外,我们提出的Q-BERT模型和子网络微调进一步提升了模型性能。该数据集公开于 https://aka.ms/wikiref。
引用
@article{arxiv.1911.03324,
title = {Transforming Wikipedia into Augmented Data for Query-Focused Summarization},
author = {Haichao Zhu and Li Dong and Furu Wei and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:1911.03324},
year = {2022}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP)