中文

一种用于发现结构化模式分类数据集特征中显式或隐式编码偏差的模糊粗糙不确定性度量

机器学习 2022-01-24 v2

摘要

测量用于解决模式识别问题的表格数据中编码的偏差的需求,已得到学术界、立法者和企业的广泛认可。在先前工作中,我们提出了一种称为模糊粗糙不确定性的偏差量化度量,其依赖于模糊粗糙集理论。直觉表明,受保护特征不应显著改变决策类的模糊粗糙边界区域。这种情况发生的程度是在决策制定语境中表现为不确定性的偏差的代理指标。我们度量的主要优势在于它不依赖于任何机器学习预测模型,而是依赖于距离函数。在本文中,我们通过探索非受保护特征中隐式编码的偏差(由受保护属性与非受保护属性之间的相关性定义)来扩展我们的研究。该分析导出了领域专家在决定如何应对偏差之前应评估的四种情形。此外,我们进行了敏感性分析以确定最能捕捉边界区域变化的模糊算子与距离函数。

关键词

引用

@article{arxiv.2108.09098,
  title  = {A fuzzy-rough uncertainty measure to discover bias encoded explicitly or implicitly in features of structured pattern classification datasets},
  author = {Gonzalo Nápoles and Lisa Koutsoviti Koumeri},
  journal= {arXiv preprint arXiv:2108.09098},
  year   = {2022}
}