Falcon:使用多臂老虎机实现公平主动学习
机器学习
2024-01-25 v2
摘要
有偏见的数据可能导致不公平的机器学习模型,这凸显了在数据分析之初,特别是在数据集整理和标注阶段,嵌入公平性的重要性。为此,我们提出了 Falcon,一个可扩展的公平主动学习框架。Falcon 采用以数据为中心的方法,通过策略性的样本选择来改善机器学习模型的公平性。给定用户指定的群体公平性度量,Falcon 识别出来自“目标群体”(例如,(属性=女性,标签=正面))的样本,这些样本对于提高公平性信息量最大。然而,一个挑战在于,这些目标群体是使用在样本选择时不可用的真实标签来定义的。为了解决这个问题,我们提出了一种新颖的试错方法,即如果预测标签与期望标签不同且落在目标群体之外,我们就推迟使用该样本。我们还观察到一种权衡:选择信息量更大的样本会导致因不期望的标签预测而推迟的可能性更高,并且最佳平衡因数据集而异。我们将信息量和推迟率之间的权衡捕捉为策略,并提议使用对抗性多臂老虎机方法自动选择最佳策略,考虑到其计算效率和理论保证。实验表明,Falcon 在公平性和准确性方面显著优于现有的公平主动学习方法,并且效率更高。特别是,只有 Falcon 支持准确性与公平性之间的适当权衡,其最高公平性得分比次优结果高 1.8-4.5 倍。
引用
@article{arxiv.2401.12722,
title = {Falcon: Fair Active Learning using Multi-armed Bandits},
author = {Ki Hyun Tae and Hantian Zhang and Jaeyoung Park and Kexin Rong and Steven Euijong Whang},
journal= {arXiv preprint arXiv:2401.12722},
year = {2024}
}
备注
Accepted to VLDB 2024