SciSummPip:一种无监督科学论文摘要生成流水线
计算与语言
2020-10-20 v1
摘要
学术文档处理(SDP)研讨会旨在鼓励在科学任务的自然语言理解方面付出更多努力。它包含三个共享任务,我们参与了 LongSumm 共享任务。在本文中,我们描述了我们的文本摘要系统 SciSummPip,其灵感来自 SummPip(Zhao 等人,2020),后者是一个面向新闻领域多文档的无监督文本摘要系统。我们的 SciSummPip 包括基于 Transformer 的语言模型 SciBERT(Beltagy 等人,2019)用于上下文句子表示、使用 PageRank(Page 等人,1999)的内容选择、结合深层与语言信息的句子图构建、句子图聚类以及图内摘要生成。我们的工作与以往方法的不同之处在于应用了内容选择和摘要长度约束以适应科学领域。在训练数据集和盲测数据集上的实验结果表明了我们方法的有效性,并且我们通过 BERTScore(Zhang 等人,2019a)实证验证了 SciSummPip 中所用模块的鲁棒性。
引用
@article{arxiv.2010.09190,
title = {SciSummPip: An Unsupervised Scientific Paper Summarization Pipeline},
author = {Jiaxin Ju and Ming Liu and Longxiang Gao and Shirui Pan},
journal= {arXiv preprint arXiv:2010.09190},
year = {2020}
}