CiteSum:基于引文文本引导的科学极端摘要与有限监督下的领域自适应
计算与语言
2022-10-21 v2
摘要
科学极端摘要(TLDR)旨在形成科学论文的超短摘要。以往策划科学 TLDR 数据集的努力由于需要大量人工标注和领域专业知识而未能规模化。在本文中,我们提出一种简单而有效的办法,从科学论文的引文文本中自动提取 TLDR 摘要。基于所提方法,我们创建了一个无需人工标注的新基准 CiteSum,其规模约为先前人工策划数据集 SciTLDR 的 30 倍。我们对 CiteSum 进行了全面分析,考察其数据特征并建立了强基线。我们通过在有限监督下将基于 CiteSum 预训练的模型(命名为 CITES)适配到新任务和领域,进一步展示了 CiteSum 的实用性。对于科学极端摘要,CITES 在 SciTLDR 上无需任何微调即优于大多数全监督方法,并仅用 128 个样本取得最先进结果。对于新闻极端摘要,CITES 在 XSum 上相比其基础模型(未在 CiteSum 上预训练)获得显著增益,例如零样本性能 ROUGE-1 提升 +7.2,以及最先进的少样本性能。对于新闻标题生成,CITES 在 Gigaword 上于无监督和零样本方法中表现最佳。我们的数据集与代码见 https://github.com/morningmoni/CiteSum。
引用
@article{arxiv.2205.06207,
title = {CiteSum: Citation Text-guided Scientific Extreme Summarization and Domain Adaptation with Limited Supervision},
author = {Yuning Mao and Ming Zhong and Jiawei Han},
journal= {arXiv preprint arXiv:2205.06207},
year = {2022}
}
备注
EMNLP 2022. TLDR: By pretraining on (automatically extracted) citation sentences in scientific papers, we achieve SOTA on SciTLDR, XSum, and Gigaword in zero-shot and (or) few-shot settings