缓存与可复现性: 让数据科学实验更快且更FAIR
软件工程
2022-11-10 v2 人工智能
摘要
中小规模数据科学实验通常依赖于个别科学家或小团队临时开发的研究软件。往往没有时间让研究软件做到快速、可复用和开放获取。其后果有两方面。首先,后续研究者必须花费大量工时在提出的假设或实验框架之上进行构建。最坏情况下,他人无法复现实验并复用发现以用于后续研究。其次,假设临时研究软件在通常长时间运行且计算昂贵的实验中失败,那么迭代改进软件并重跑实验的总体工作量会给研究者带来显著的时间压力。我们建议将缓存作为研究软件开发过程不可或缺的一部分,甚至在写第一行代码之前就如此。本文概述了在数据科学项目中开发研究软件的缓存建议。我们的建议提供了一种视角以规避常见的问题如专有依赖、速度等。同时,缓存在开放科学工作流中有助于实验的可复现性。关于四大指导原则,即可发现性、可访问性、互操作性和可复用性(FAIR),我们预见将所提建议纳入研究软件开发,将使该软件相关数据对机器和人类都更FAIR。我们在近期完成的数学信息检索研究软件项目上展示了部分建议的实用性。
引用
@article{arxiv.2211.04049,
title = {Caching and Reproducibility: Making Data Science experiments faster and FAIRer},
author = {Moritz Schubotz and Ankit Satpute and Andre Greiner-Petter and Akiko Aizawa and Bela Gipp},
journal= {arXiv preprint arXiv:2211.04049},
year = {2022}
}
备注
8 pages, 1 table