中文

一种面向科学数据集与分析流水线的推荐系统

信息检索 2021-08-23 v1 机器学习

摘要

出于开放科学的考量,科学数据集与分析流水线正日益被公开共享。然而,缺乏可靠机制来辨识哪些流水线可与哪些数据集恰当配合使用。鉴于高质量公共数据集与流水线数量不断增加,这种清晰兼容性的缺失威胁到这些资源的可发现性与可重用性。我们考察了基于先前执行的溯源记录、以协同过滤系统推荐流水线与数据集的可行性。我们使用从加拿大开放神经科学平台(一项开放神经科学的全国性倡议)提取的数据集与流水线评估我们的系统。我们的系统所给推荐(AUC=0.83=0.83)显著优于随机,并胜过领域专家利用其既往知识以及流水线与数据集描述所做的推荐(AUC=0.63=0.63)。特别地,领域专家常忽视流水线-数据集交互中的底层技术方面,如预处理水平,而这些正被基于溯源的系统所捕获。我们得出结论:基于溯源的流水线与数据集推荐器是可行的,且有益于开放科学资源的共享与使用。未来工作将聚焦于收集更全面的溯源轨迹,并将该系统部署至生产环境。

关键词

引用

@article{arxiv.2108.09275,
  title  = {A Recommender System for Scientific Datasets and Analysis Pipelines},
  author = {Mandana Mazaheri and Gregory Kiar and Tristan Glatard},
  journal= {arXiv preprint arXiv:2108.09275},
  year   = {2021}
}