NSF-SciFy: 从国家科学基金项目摘要中挖掘科学主张
计算与语言
2026-05-27 v3
摘要
我们介绍 NSF-SciFy,这是一个来自国家科学基金 (NSF) 项目摘要中提取的科学主张与调查提案的综合数据集。虽然以往科学主张验证数据集在规模和范围上受限,NSF-SciFy 代表了重大进步,包含来自所有科学与数学学科的 280 万条主张,涵盖 40 万篇摘要。我们提供了两个聚焦子集:NSF-SciFy-MatSci 包含来自材料科学项目的 11.4 万条主张,NSF-SciFy-20K 覆盖五个 NSF 部门的 13.5 万条主张。通过 zero-shot prompting,我们开发了一种可扩展的方法,用于联合提取科学主张与调查提案。我们通过三个下游任务展示了数据集的实用性:非技术性摘要生成、主张提取与调查提案提取。对数据集进行微调的语言模型实现了显著提升,尤其在主张与提案提取任务中常实现百分之百以上的相对增益。我们的错误分析显示,提取的主张精度较高但召回率较低,表明仍有方法论改进的潜力。NSF-SciFy 开启了大规模主张验证、科学发现跟踪与元科学分析等新研究方向。代码与数据已发布于 https://github.com/darpa-scify/NSFSciFy。
引用
@article{arxiv.2503.08600,
title = {NSF-SciFy: Mining the NSF Awards Database for Scientific Claims},
author = {Delip Rao and Weiqiu You and Eric Wong and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2503.08600},
year = {2026}
}
备注
ACL 2026. 19 pages, 7 figures, 11 tables