flowengineR:面向公平性与可重复性工作流程设计的模块化可扩展框架
机器学习
2025-11-04 v1 计算机与社会
统计方法学
摘要
flowengineR是一个为通用机器学习管线构建可重复算法工作流程提供模块化可扩展框架的R包。它源于算法公平性领域的快速演变之所驱动,该领域不断涌现新的指标、缓解策略和机器学习方法。公平性(但也超出公平性范畴)的核心挑战在于,现有工具么要么聚焦于单一干预,要么将可重复性和可扩展性作为次要考虑而非核心设计原则。flowengineR通过引入用于数据划分、执行、预处理、训练、内置、后处理、评估和报告的标准化引擎,解决了这一问题。每个引擎封装一个方法ological任务,却通过轻量级接口进行通信,确保工作流程保持透明、可审计且易于扩展。虽然在R中实现,但flowengineR建立在工作流程语言(CWL、YAWL)、图形导向可视化编程语言(KNIME)以及R框架(BatchJobs、batchtools)的思想之上。其侧重点不在于为实现可靠的并行执行而调度引擎,而在于对不同引擎的直观设置与管理。这种正交化实现了分布式职责、独立开发和简化的集成。在公平性语境下,通过将公平性方法结构化为可互换的引擎,flowengineR使研究人员能够整合、比较和评估建模管线中的干预措施。同时,该架构也适用于可解释性、鲁棒性和合规性指标,而无需修改核心设计。在引发公平性的动机之外,它最终为任何可重复性、透明性和可扩展性至关重要的工作流程上下文提供了通用基础设施。
引用
@article{arxiv.2511.00079,
title = {flowengineR: A Modular and Extensible Framework for Fair and Reproducible Workflow Design in R},
author = {Maximilian Willer and Peter Ruckdeschel},
journal= {arXiv preprint arXiv:2511.00079},
year = {2025}
}
备注
27 pages, 7 figures, 1 table