ARMAN:面向波斯语抽象式摘要的语义选择与句子重排序预训练方法
计算与语言
2021-09-10 v1
摘要
抽象式文本摘要是受预训练语言模型兴起影响的领域之一。当前抽象式摘要的预训练工作更青睐与主文本共有更多词汇的摘要,而较少关注生成句子与原始文档之间的语义相似度。我们提出 ARMAN,一种基于 Transformer 的编码器-解码器模型,并通过三个新颖的目标进行预训练以解决此问题。在 ARMAN 中,根据改进的语义分数从文档中选出显著句子进行掩码,形成伪摘要。为了更准确地总结并模仿人类写作模式,我们应用了改进的句子重排序。我们在六个下游波斯语摘要任务上评估了所提出的模型。实验结果表明,我们提出的模型在所有六个摘要任务上均达到了由 ROUGE 和 BERTScore 衡量的最先进性能。我们的模型在文本蕴含、问题改写和多项选择问答任务中也优于先前的工作。最后,我们建立了人工评估,并表明使用语义分数能显著改善摘要结果。
引用
@article{arxiv.2109.04098,
title = {ARMAN: Pre-training with Semantically Selecting and Reordering of Sentences for Persian Abstractive Summarization},
author = {Alireza Salemi and Emad Kebriaei and Ghazal Neisi Minaei and Azadeh Shakery},
journal= {arXiv preprint arXiv:2109.04098},
year = {2021}
}