从数据漂移视角看学习中的非侵入式公平性
机器学习
2023-08-10 v4 数据库
摘要
机器学习(ML)模型被广泛用于驱动许多现代数据系统。尽管它们无疑是强大的工具,ML模型常表现出不平衡的性能与不公平行为。该问题的根源往往在于不同子群体通常呈现相异的趋势:当学习算法试图识别数据中的趋势时,它自然偏向于多数群体的趋势,从而导致对少数群体表现不佳且不公平的模型。我们的目标是通过仅施加非侵入式干预(即不改动数据或学习算法)来提升ML模型的公平性与可信度。我们利用一个简单但关键的洞察:不同群体之间、进而学习到的模型与少数群体之间的趋势分歧,类似于数据漂移,后者表明数据各部分与训练模型之间契合度较差。我们探索了两种策略(模型拆分与重加权)来解决此漂移,旨在提升模型对底层数据的整体契合度。我们的两种方法均提出了运用近期提出的一致性约束(Conformance Constraints)数据剖析原语的新方式。我们在7个真实数据集上的实验评估表明,DifFair与ConFair均提升了ML模型的公平性。我们展示了DifFair具有优势的场景,尽管ConFair具有最大的实际影响并优于其他基线。此外,作为一种模型无关技术,ConFair在用于不同于学习权重时所基于的模型时仍保持鲁棒,而其他state of the art方法则不然。
引用
@article{arxiv.2303.17566,
title = {Non-Invasive Fairness in Learning through the Lens of Data Drift},
author = {Ke Yang and Alexandra Meliou},
journal= {arXiv preprint arXiv:2303.17566},
year = {2023}
}