中文

利用逐点表征相似性考察公平性干预的影响

机器学习 2025-05-23 v2

摘要

机器学习(ML)算法常表现出歧视性行为,对受保护群体的某些人群产生负面影响。为此,人们提出了大量去偏方法以及相应的评估指标。现有的去偏方法评估指标存在两个主要局限:(1)它们主要提供不公平性的全局估计,无法进行更细粒度的分析;(2)它们主要分析模型在特定任务上的输出,无法将发现推广到其他任务。本文引入逐点归一化核对齐(PNKA),一种逐点表征相似性度量,通过衡量去偏措施如何影响个体的中间表征来应对上述局限。在表格数据上,PNKA 的使用揭示了先前未知的见解:群体公平性主要影响的只是人群中的一小部分,同时保持多数人的高表征相似性;而个体公平性约束则在整个群体中均匀影响表征,改变了几乎每一个数据点。我们表明,通过使用 PNKA 评估表征,可以可靠地预测在这些表征上训练的 ML 模型的行为。此外,将 PNKA 应用于语言嵌入显示,现有的去偏方法可能并未按预期工作,未能从刻板词语和句子中移除偏见。我们的发现表明,当前用于去偏方法的评估指标是不充分的,凸显了深入理解去偏方法影响的必要性,并展示了逐点表征相似性度量如何有助于公平性审计。

关键词

引用

@article{arxiv.2305.19294,
  title  = {Investigating the Effects of Fairness Interventions Using Pointwise Representational Similarity},
  author = {Camila Kolling and Till Speicher and Vedant Nanda and Mariya Toneva and Krishna P. Gummadi},
  journal= {arXiv preprint arXiv:2305.19294},
  year   = {2025}
}