公平性增强的混合效应深度学习改善分布内与分布外聚类(非独立同分布)数据的公平性
机器学习
2024-12-31 v5
摘要
传统深度学习(DL)模型存在两个普遍局限。首先,它们假设训练样本独立同分布(i.i.d),这一假设在真实数据集中常被违背,因为由于重复测量(例如纵向研究中同一受试者或同一测序仪的细胞)样本间存在额外相关性。这导致性能下降、泛化受限以及协变量混杂,进而引发第一类和第二类错误。其次,DL 模型通常优先整体准确率,偏向多数群体准确率而牺牲代表性不足子群体的性能,导致不公平、有偏的模型。在影响贷款审批与医疗决策的模型中,此问题尤为关键,亟需修正。为解决这些问题,我们提出公平混合效应深度学习(Fair MEDL)框架。该框架通过以下方式量化簇不变固定效应(FE)与簇特定随机效应(RE):1)用于学习不变 FE 的簇对抗器,2)用于 RE 的贝叶斯神经网络,以及 3)结合 FE 与 RE 进行最终预测的混合函数。公平性通过对抗去偏网络引入的架构与损失函数改动得以增强。我们正式定义并展示了在分类与回归任务上三类指标——均衡赔率、人口均等与反事实公平性——的公平性提升。我们的方法还识别并降低混杂协变量的权重,缓解第一类与第二类错误。该框架在跨越金融与医疗两个行业的三个数据集上进行了全面评估。Fair MEDL 框架将 Age、Race、Sex 与 Marital status 的公平性分别提升 86.4%、64.9%、57.8% 与 36.2%,同时保持稳健的预测性能。
引用
@article{arxiv.2310.03146,
title = {Fairness-enhancing mixed effects deep learning improves fairness on in- and out-of-distribution clustered (non-iid) data},
author = {Son Nguyen and Adam Wang and Albert Montillo},
journal= {arXiv preprint arXiv:2310.03146},
year = {2024}
}