中文

无异常值检测偏差被粉碎:通过数据中心因素理解算法偏差来源

机器学习 2024-08-28 v1 计算机与社会

摘要

机器学习的惊人成功引发了对其在现实环境中公平性的日益担忧。然而,关于公平性的研究主要聚焦于监督式机器学习,而无监督异常值检测(OD)——在金融、安保等领域有大量应用——受到很少关注。虽然已有少数研究提出公平性增强型OD算法,但这些方法对 underlying 驱动机制或不公平来源毫无了解。即便在监督式机器学习文献中,也关于不公平来源究竟源于算法偏差(即设计选择)还是源于训练数据的偏差仍存争议。为弥合这一差距,本工作旨在通过审计不同数据中心因素下的OD模型,揭示OD中可能的不公平来源。通过向输入数据中注入各种已知偏差——包括样本规模差异、欠 représent、特征测量噪声和群体成员隐蔽——我们发现所研究的OD算法都存在公平性缺陷,尽管对不同类型数据偏差的敏感性各不相同。本研究最突出的发现是,OD算法偏差不仅是数据偏差问题。关键认识是,来自偏差注入的数据属性可以是天然产生的——例如关于稀疏性、基本率、方差和多模态性的自然群体差异。无论是天然属性还是偏差属性,这些数据属性都可能在与特定算法设计选择相互作用时导致不公平。

关键词

引用

@article{arxiv.2408.13667,
  title  = {Outlier Detection Bias Busted: Understanding Sources of Algorithmic Bias through Data-centric Factors},
  author = {Xueying Ding and Rui Xi and Leman Akoglu},
  journal= {arXiv preprint arXiv:2408.13667},
  year   = {2024}
}

备注

11 pages, 5 figures, 16 appendix pages, accepted at AIES 2024