中文

基于分布鲁棒优化的生存分析公平性

机器学习 2024-09-18 v1 机器学习

摘要

我们提出了一种通用方法,通过最小化所有出现概率至少为用户指定值的子群体上的最坏情况误差,来促进生存分析模型的公平性。该方法可用于将许多现有的生存分析模型转化为同时促进公平性的模型,而无需用户指定在训练损失函数中哪些属性或特征应被视为敏感属性。从技术角度来看,我们的方法将分布鲁棒优化(DRO)的最新发展应用于生存分析。其复杂性在于,现有的DRO理论使用的训练损失函数可分解为各个数据点的贡献之和,即损失函数中出现的任何项仅依赖于单个训练点。这种分解对于常用的生存损失函数并不成立,包括Cox比例风险模型、其深度神经网络变体,以及许多其他使用涉及排序或相似度得分计算的损失函数的最新模型。我们使用样本拆分策略来解决这一技术难题。我们通过使用样本拆分DRO方法,为包括Cox模型(及其深度变体DeepSurv)、离散时间模型DeepHit和神经ODE模型SODEN在内的多种现有生存分析模型创建了公平版本,以此展示该方法。我们还建立了有限样本理论保证,以证明我们的样本拆分DRO损失收敛于何种值。对于Cox模型,我们进一步推导出一种不使用样本拆分的精确DRO方法。对于我们转化为DRO变体的所有模型,我们表明,与现有的生存分析公平性正则化技术相比,DRO变体在最近建立的公平性指标上通常得分更高(且准确率没有显著下降)。

关键词

引用

@article{arxiv.2409.10538,
  title  = {Fairness in Survival Analysis with Distributionally Robust Optimization},
  author = {Shu Hu and George H. Chen},
  journal= {arXiv preprint arXiv:2409.10538},
  year   = {2024}
}

备注

Accepted at the Journal of Machine Learning Research; this paper is a journal paper extension of our earlier Machine Learning for Health 2022 paper (arXiv:2211.10508)