从数据到决策:面向可重复性协作 eScience 的数据中心化基础设施
机器学习
2025-06-23 v1 数据库
数字图书馆
人机交互
摘要
可重复性仍是机器学习(ML)中核心挑战,尤其是在团队在数据、特征和模型上进行迭代的协作式科学项目中。当前的 ML 工作流程往往是动态且碎片化的,依赖非正式的数据共享、临时性脚本和松散连接的工具。这种碎片化阻碍了透明性、可重复性以及实验随时间推移的可适应性。本文引入一种以生命周期为导向的可重复性数据中心化框架,核心包含六类结构化产物:数据集(Dataset)、特征(Feature)、工作流程(Workflow)、执行(Execution)、资产(Asset)以及受控词汇表(Controlled Vocabulary)。这些产物规范了数据、代码与决策之间的关系,使 ML 实验能够实现版本化、可解释性及其随时间的可追溯性。本文通过眼底虹膜糖尿病检测的临床 ML 用例,展示了该系统如何支持迭代探索,提升可重复性,并在 ML 生命周期中保留协作决策的源头信息。
引用
@article{arxiv.2506.16051,
title = {From Data to Decision: Data-Centric Infrastructure for Reproducible ML in Collaborative eScience},
author = {Zhiwei Li and Carl Kesselman and Tran Huy Nguyen and Benjamin Yixing Xu and Kyle Bolo and Kimberley Yu},
journal= {arXiv preprint arXiv:2506.16051},
year = {2025}
}