ParaSCI:面向长释义生成的大规模科学释义数据集
计算与语言
2021-02-08 v2
摘要
我们提出 ParaSCI,科学领域首个大规模释义数据集,包含来自 ACL 的 33,981 对释义(ParaSCI-ACL)和来自 arXiv 的 316,063 对释义(ParaSCI-arXiv)。深入挖掘科学论文的特征与常见模式,我们通过论文内和论文间方法构建该数据集,例如收集对同一篇论文的引用或按科学术语聚合定义。为利用部分被释义的句子,我们提出 PDBERT 作为一种通用的释义发现方法。ParaSCI 中释义的主要优势在于显著的长度与文本多样性,这补充了现有的释义数据集。ParaSCI 在人类评估与下游任务(尤其是长释义生成)上取得了令人满意的结果。
引用
@article{arxiv.2101.08382,
title = {ParaSCI: A Large Scientific Paraphrase Dataset for Longer Paraphrase Generation},
author = {Qingxiu Dong and Xiaojun Wan and Yue Cao},
journal= {arXiv preprint arXiv:2101.08382},
year = {2021}
}