帕累托前沿上机器学习的公平数据表示
机器学习
2023-11-27 v4 机器学习
概率论
摘要
随着机器学习驱动的决策在日常生活中日益重要,力求底层数据处理中的公平性势在必行。我们提出一种用于公平数据表示的预处理算法,通过它监督学习可估计预测误差与统计差异之间帕累托前沿。特别地,本工作应用最优仿射传输,经由预处理数据形变来逼近基于后处理 Wasserstein-2 重心刻画的最优公平 目标监督学习。此外,我们表明,从学习结果的(关于敏感信息的)条件分布到其重心的 Wasserstein-2 测地线刻画了学习结果上 损失与敏感组间平均成对 Wasserstein-2 距离之间的帕累托前沿。数值模拟凸显了以下优势:(1) 预处理步骤可与任意条件期望估计监督学习方法及未观测数据复合;(2) 公平表示通过限制剩余数据相对于敏感数据的推断能力来保护敏感信息;(3) 最优仿射映射即使对高维数据也计算高效。
引用
@article{arxiv.2201.00292,
title = {Fair Data Representation for Machine Learning at the Pareto Frontier},
author = {Shizhou Xu and Thomas Strohmer},
journal= {arXiv preprint arXiv:2201.00292},
year = {2023}
}
备注
63 pages, 7 figures