中文

协变量偏移下的公平性:利用少量无标签测试样本改善公平-准确权衡

机器学习 2024-01-09 v3 人工智能

摘要

测试数据中的协变量偏移是一种常见实际现象,会显著降级模型的准确性与公平性表现。由于刑事司法等社会影响,在协变量偏移下确保不同敏感群体间的公平性至关重要。我们在无监督设定下工作,仅可获得少量无标签测试样本及一个有标签训练集。为在这一极具挑战但现实的场景下改善公平性,我们做出三点贡献。其一是基于复合加权熵的新型预测准确性目标,其与用于公平性的表示匹配损失一同优化。我们通过实验验证,在多个标准数据集上,采用我们的损失公式进行优化在公平-准确权衡的帕累托意义下优于若干 SOTA 基线。我们的第二个贡献是一个我们称之为非对称协变量偏移的新设定,据我们所知此前未被研究。非对称协变量偏移发生在一个群体的协变量分布相较其他群体显著偏移时,这出现于主导群体被过度代表的情况。尽管该设定对当前基线极具挑战,我们展示所提方法显著优于它们。我们的第三个贡献是理论性的,我们证明加权熵项与训练集上的预测损失共同近似了协变量偏移下的测试损失。通过经验与形式化样本复杂度界,我们表明这一对未见测试损失的近似不依赖于影响许多其他基线的重要性采样方差。

关键词

引用

@article{arxiv.2310.07535,
  title  = {Fairness under Covariate Shift: Improving Fairness-Accuracy tradeoff with few Unlabeled Test Samples},
  author = {Shreyas Havaldar and Jatin Chauhan and Karthikeyan Shanmugam and Jay Nandy and Aravindan Raghuveer},
  journal= {arXiv preprint arXiv:2310.07535},
  year   = {2024}
}

备注

Accepted at The 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024)