中文

临床存在下的填补策略:对算法公平性的影响

人工智能 2025-03-19 v4 机器学习

摘要

机器学习有可能强化数据中存在的偏见,且如我们在本工作中所论证的,也会强化数据中缺失部分的偏见。在医疗领域,社会与决策偏见塑造了缺失数据的模式,然而针对群体特异性缺失的算法公平性影响却鲜被理解。我们在医疗中处理缺失性的方式会对下游算法公平性产生有害影响。我们的工作质疑当前旨在处理缺失数据的建议与实践,聚焦其对算法公平性的影响,并提供前进路径。具体而言,我们考量现有建议的理论基础,以及其经验预测性能与通过子群表现衡量的相应算法公平性。结果显示,当前处理缺失性的实践缺乏原则性基础,与医疗中缺失机制的现实脱节,且可能适得其反。例如,我们表明偏好群体特异性填补策略可能是误导性的,并会加剧预测差异。我们继而基于发现提出一个经验指导填补选择的框架,及配套的报告框架。我们的工作对监管者与从业者近期应对真实世界数据现实、促进机器学习系统负责任且透明部署的努力,构成重要贡献。我们通过在广泛使用的数据集上实验展示所提框架的实用价值,表明该框架如何指导填补策略选择,使我们能在整体预测性能相等但算法公平性属性不同的策略间作出选择。

关键词

引用

@article{arxiv.2208.06648,
  title  = {Imputation Strategies Under Clinical Presence: Impact on Algorithmic Fairness},
  author = {Vincent Jeanselme and Maria De-Arteaga and Zhe Zhang and Jessica Barrett and Brian Tom},
  journal= {arXiv preprint arXiv:2208.06648},
  year   = {2025}
}

备注

Full Journal Version under review; Presented at the conference Machine Learning for Health (ML4H) 2022 Published in the Proceedings of Machine Learning Research (193)