中文

公平性不仅是伦理问题:通过数据相关性调谐来缓解机器学习软件中的偏见

软件工程 2025-12-29 v1 人工智能

摘要

传统软件公平性研究通常侧重伦理和社会诉求,忽视了公平性本质上是由敏感用户群体之间性能差异引发的核心软件质量问题。将公平性明确作为软件质量维度具有实际收益,包括改善底层用户组的预测性能、增强分布外推理能力以及提升现实部署中的地理可迁移性。然而,现有偏差缓解方法面临关键困境:虽然预处理方法在模型类型上具有广泛适用性,但通常不如后处理技术有效。为克服这一挑战,我们提出了相关性调谐(CoT)方法,这是一种新型预处理方法,通过调整数据相关性来缓解偏见。具体而言,CoT 引入 Phi 系数这一直观相关性度量,以系统性地量化敏感属性与标签之间的相关性,并采用多目标优化解决代理偏见。广泛的实验评估表明,CoT 将底层用户组的真阳性率平均提高 17.5%,并将统计公平差异(SPD)、平均机会差异(AOD)和平等机会差异(EOD)等三项关键偏差指标降低超过 50%。在单属性和多属性情景中,CoT 分别在性能上优于最先进方法高出 3 个和 10 个百分点。我们将公开发布实验结果和源代码,以促进未来研究。

关键词

引用

@article{arxiv.2512.21348,
  title  = {Fairness Is Not Just Ethical: Performance Trade-Off via Data Correlation Tuning to Mitigate Bias in ML Software},
  author = {Ying Xiao and Shangwen Wang and Sicen Liu and Dingyuan Xue and Xian Zhan and Yepang Liu and Jie M. Zhang},
  journal= {arXiv preprint arXiv:2512.21348},
  year   = {2025}
}

备注

Accepted to the 48th International Conference on Software Engineering (ICSE 2026) Research Track