Soft-Search:用于研究科研软件识别与生产的两个数据集
数字图书馆
2023-03-01 v1 软件工程
摘要
软件是学术研究的重要工具,但在许多情况下,为科研生产的软件并不易于识别或发现。连接研究与软件的潜在第一步是软件识别。在本文中,我们展示了两个用于研究科研软件识别与生产的数据集。第一个数据集包含来自美国国家科学基金会(NSF)资助研究项目的近 1000 条人工标注的软件生产记录。我们使用该数据集训练预测软件生产的模型。我们的第二个数据集是通过对 2010 年至 2023 年间所有 NSF 资助项目的摘要和项目成果报告应用训练好的预测模型而创建的。其结果是一个涵盖超过 150,000 项 NSF 资助的软件生产推断数据集。我们发布了 Soft-Search 数据集,以辅助识别和理解科研软件的生产:https://github.com/si2-urssi/eager
引用
@article{arxiv.2302.14177,
title = {Soft-Search: Two Datasets to Study the Identification and Production of Research Software},
author = {Eva Maxfield Brown and Lindsey Schwartz and Richard Lewei Huang and Nicholas Weber},
journal= {arXiv preprint arXiv:2302.14177},
year = {2023}
}