中文

通过识别数据中的偏差同时提升机器学习模型的公平性与性能

机器学习 2022-10-25 v1 计算机与社会

摘要

建立在包含归因于各种潜在因素的歧视性实例的数据集上的机器学习模型会产生有偏且不公平的结果。现有偏差缓解策略常常为确保公平性而牺牲准确率,这是一个有充分依据且直观的事实。但当AI引擎的预测被用于反映收入或运营效率的决策(如信用风险建模)时,若准确率能以某种方式得到合理保持,对业务而言将是可取的。这种在AI中维持准确率与公平性的矛盾需求推动了我们的研究。本文中,我们提出一种在现实范式下同时提升ML模型公平性与准确率的新方法。我们工作的本质是一种数据预处理技术,可在训练前检测应被从数据集中移除的归因于特定偏差的实例,并进一步表明此类实例移除不会对模型准确率产生不利影响。具体而言,我们主张在存在因受保护属性变化导致特征相似但标签不同的实例的问题设定中,数据集会引入固有偏差,该偏差可通过我们的新方案识别并缓解。我们在两个开源数据集上的实验评估展示了所提方法如何缓解偏差并提升而非降低准确率,同时为终端用户提供某种可控性。

关键词

引用

@article{arxiv.2210.13182,
  title  = {Simultaneous Improvement of ML Model Fairness and Performance by Identifying Bias in Data},
  author = {Bhushan Chaudhari and Akash Agarwal and Tanmoy Bhowmik},
  journal= {arXiv preprint arXiv:2210.13182},
  year   = {2022}
}