数据之初:面向算法公平性的可靠与可复现研究的FairGround语料库
机器学习
2025-10-28 v1 计算机与社会
机器学习
摘要
随着机器学习(ML)系统在高风险决策领域的广泛应用,确保其输出的公平性已成为核心挑战。公平ML研究的核心在于用于检验偏差并开发缓解策略的数据集。然而,现有工作依赖狭窄数据集选择——常为任意挑选、处理不一致且缺乏多样性——削弱了结果的可推广性与可复现性。为此,我们提出FairGround:一个统一框架、数据语料库及Python软件包,旨�推进公平ML分类领域的可复现研究与批判性数据研究。FairGround目前包含44个表格数据集,每个数据集均标注有丰富的公平相关元数据。我们的Python软件包标准化了数据集加载、预处理、转换与划分,简化了实验工作流程。通过提供多样且文档完善的数据集语料库及稳健工具,FairGround支持开发更公平、更可靠、更可复现的ML模型。所有资源均公开提供,以支持开放与合作研究。
引用
@article{arxiv.2510.22363,
title = {Bias Begins with Data: The FairGround Corpus for Robust and Reproducible Research on Algorithmic Fairness},
author = {Jan Simson and Alessandro Fabris and Cosima Fröhner and Frauke Kreuter and Christoph Kern},
journal= {arXiv preprint arXiv:2510.22363},
year = {2025}
}
备注
Website: https://reliable-ai.github.io/fairground/