中文

研究面向子群公平性的数据干预:一项 ICU 案例研究

机器学习 2026-04-07 v1

摘要

在机器学习模型用于自动化个体决策的高风险环境中,算法偏见的存在会加剧对特定人群子群的系统性伤害。这些偏见通常源于底层的训练数据。在实践中,“修复数据”的干预措施取决于实际可用的额外数据源——其中许多远非理想。在这些情况下,数据规模扩展对子群性能的影响变得不稳定,因为样本量增加带来的改进被训练集中引入的分布偏移所抵消。在本文中,我们研究了在医疗保健背景下结合数据源以改善子群性能的局限性。临床模型通常在由来自不同医院或入院科室的患者电子健康记录(EHR)数据组成的数据集上进行训练。通过两个这样的数据集——eICU 协作研究数据库和 MIMIC-IV 数据集,我们发现数据添加既可能帮助也可能损害模型的公平性和性能,并且许多直观的数据选择策略并不可靠。我们比较了基于模型的事后校准和以数据为中心的添加策略,发现两者的结合对于改善子群性能至关重要。我们的工作通过比较和结合基于数据和基于模型的方法,对“更好的数据”能克服公平性挑战的传统教条提出了质疑。

关键词

引用

@article{arxiv.2604.03478,
  title  = {Investigating Data Interventions for Subgroup Fairness: An ICU Case Study},
  author = {Erin Tan and Judy Hanwen Shen and Irene Y. Chen},
  journal= {arXiv preprint arXiv:2604.03478},
  year   = {2026}
}