中文

低资源环境下使用预训练语言模型的长文档摘要

计算与语言 2021-03-02 v1

摘要

抽取式摘要是将长文档压缩为连贯短文同时保留 salient 信息的任务。现代抽取式摘要方法基于深度神经网络,通常需要大型训练数据集。由于收集摘要数据集昂贵且耗时,实际工业环境通常处于低资源状态。本文研究一种具有挑战性的低资源设置:对平均源文档长度为4268词、仅120个可用(文档,摘要)对的长期法律简报进行摘要。为应对数据稀缺,我们使用了现代预训练抽取式摘要器BART (Lewis et al., 2020),其仅达到17.9 ROUGE-L,因为它难以处理长文档。因此我们尝试通过识别源文档中最能支撑摘要的 salient 句子来压缩这些长文档,使用一种基于GPT-2 (Radford et al., 2019)语言模型困惑度分数的新颖算法,该算法在低资源机制下运行。将压缩文档输入BART后,我们观察到ROUGE-L提升6.0。我们的方法也击败了多个有竞争力的显著性检测基线。此外,所识别的 salient 句子与领域专家独立的人工标注趋于一致。

关键词

引用

@article{arxiv.2103.00751,
  title  = {Long Document Summarization in a Low Resource Setting using Pretrained Language Models},
  author = {Ahsaas Bajaj and Pavitra Dangati and Kalpesh Krishna and Pradhiksha Ashok Kumar and Rheeya Uppaal and Bradford Windsor and Eliot Brenner and Dominic Dotterrer and Rajarshi Das and Andrew McCallum},
  journal= {arXiv preprint arXiv:2103.00751},
  year   = {2021}
}