中文

任务定制预处理:公平的下游监督学习

机器学习 2026-01-21 v1 统计方法学 机器学习

摘要

公平性感知的机器学习最近吸引了各个社区,以减轻数据驱动任务中对特定社会群体的歧视。对于公平的监督学习,特别是在预处理阶段,主要存在两类方法:数据公平性和任务定制公平性。前者直接在各群体间寻找一个中间分布,独立于下游模型的类型,因此学习到的下游分类/回归模型会对输入相同协变量的个体返回相似的预测分数,无论其敏感属性如何。后者在构建预处理映射时,明确考虑了监督学习任务。在这项工作中,我们研究了监督学习的算法公平性,并认为从 HGR 相关性的角度来看,数据公平性方法施加了过强的正则化。这促使我们设计了一种为监督学习量身定制的新型预处理方法。我们在获取预处理映射时考虑了公平性与效用之间的权衡。然后,我们研究了在转换后数据上学习的任意下游监督模型的行为,以找到保证其公平性提升和效用保持的充分条件。据我们所知,在任务定制方法分支中,尚无先前工作从理论上研究使用预处理数据时的下游保证。我们通过基于表格和图像数据集的比较研究进一步评估了我们的框架,结果表明,与最近的竞争模型相比,我们的框架在多个下游模型中保持了稳定的权衡,显示出优越性。特别是在计算机视觉数据上,我们发现我们的方法仅改变与核心机器学习任务相关的必要语义特征来实现公平性。

引用

@article{arxiv.2601.11897,
  title  = {Task-tailored Pre-processing: Fair Downstream Supervised Learning},
  author = {Jinwon Sohn and Guang Lin and Qifan Song},
  journal= {arXiv preprint arXiv:2601.11897},
  year   = {2026}
}