中文

基于 Wasserstein 的机器学习模型公平性可解释性框架

机器学习 2022-07-25 v5 概率论

摘要

本文旨在引入一种公平性可解释性框架,用于在分布层面度量并解释分类与回归模型中的偏差。在我们的工作中,我们使用 Wasserstein 度量来度量模型输出中跨子群体分布的模型偏差。为恰当量化预测变量的贡献,我们考虑模型与预测变量相对于非保护类的有利性。该量化通过传输理论实现,由此产生模型偏差的分解以及将偏差解释分解为正向与负向贡献。为更深入理解有利性的作用并允许偏差解释的可加性,我们改编了合作博弈论的技术。

关键词

引用

@article{arxiv.2011.03156,
  title  = {Wasserstein-based fairness interpretability framework for machine learning models},
  author = {Alexey Miroshnikov and Konstandinos Kotsiopoulos and Ryan Franks and Arjun Ravi Kannan},
  journal= {arXiv preprint arXiv:2011.03156},
  year   = {2022}
}

备注

39 pages. (submitted for publication)