中文

公平PCA的代价:多一维

机器学习 2018-11-02 v1 机器学习

摘要

我们研究标准降维技术PCA是否无意中对两个不同群体产生了保真度不同的数据表示。我们在多个真实世界数据集上表明,PCA在群体A上的重构误差高于群体B(例如女性相对于男性,或低学历相对于高学历个体)。即使数据集中来自A和B的样本数相近,也可能发生这种情况。这促使我们研究对A和B保持相似保真度的降维技术。我们定义公平PCA的概念,并给出一种多项式时间算法,用于寻找相对于该度量近乎最优的数据低维表示。最后,我们在真实世界数据集上表明,我们的算法可用于高效生成数据的公平低维表示。

关键词

引用

@article{arxiv.1811.00103,
  title  = {The Price of Fair PCA: One Extra Dimension},
  author = {Samira Samadi and Uthaipon Tantipongpipat and Jamie Morgenstern and Mohit Singh and Santosh Vempala},
  journal= {arXiv preprint arXiv:1811.00103},
  year   = {2018}
}