OARelatedWork:来自开放获取来源的大规模相关工作数据集
计算与语言
2024-05-06 v1
摘要
本文介绍了 OARelatedWork,即首个大规模多文档摘要数据集,用于相关工作生成,包含完整的相关工作章节及引用论文的全文。该数据集包含 94 450 篇论文和 5 824 689 篇唯一引用论文。该数据集旨在用于自动生成相关工作,以推动该领域向从所有可用内容生成完整相关工作章节,而不是仅从摘要生成相关工作部分,这是当前该领域抽象方法的主流做法。我们展示了在使用全文而非摘要时,提取式摘要的上限在 ROUGE-2 分数上提升了 217%。此外,我们展示了全内容数据对 naive、oracle、传统和基于 Transformer 的基线模型的益处。长输出(如相关工作章节)因输入长度受限,导致自动评估指标(如 BERTScore)面临挑战。我们通过提出并评估了一个基于 BERTScore 的 meta 指标来解决此问题。尽管该 meta 指标在较小的块上运行,但我们展示了该指标与人类判断的相关性,相当于原始 BERTScore。
引用
@article{arxiv.2405.01930,
title = {OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources},
author = {Martin Docekal and Martin Fajcik and Pavel Smrz},
journal= {arXiv preprint arXiv:2405.01930},
year = {2024}
}