中文

将静态公平性适配于序列决策:面向均等长期受益率的偏差缓解策略

机器学习 2024-05-29 v3 计算机与社会

摘要

机器学习模型所做的决策可能产生持久影响,使得长期公平性成为一个关键考量。已有观察表明,忽略长期效应并直接在静态设定中应用公平性准则,反而会随着时间加剧偏差。为解决序列决策中的偏差问题,我们引入了一种称为均等长期受益率(Equal Long-term Benefit Rate, ELBERT)的长期公平性概念。该概念被无缝集成到马尔可夫决策过程(MDP)中,以考量动作对未来长期公平性的影响,从而为公平的序列决策问题提供了一个统一框架。ELBERT有效解决了先前长期公平性概念中发现的时间歧视问题。此外,我们证明了长期受益率的策略梯度可解析地简化为标准策略梯度。这一简化使得常规策略优化方法可用于降低偏差,从而产生了我们的偏差缓解方法 ELBERT-PO。在多种不同序列决策环境中的大量实验一致表明,ELBERT-PO在保持高 utility 的同时显著减少了偏差。代码见 https://github.com/umd-huang-lab/ELBERT。

关键词

引用

@article{arxiv.2309.03426,
  title  = {Adapting Static Fairness to Sequential Decision-Making: Bias Mitigation Strategies towards Equal Long-term Benefit Rate},
  author = {Yuancheng Xu and Chenghao Deng and Yanchao Sun and Ruijie Zheng and Xiyao Wang and Jieyu Zhao and Furong Huang},
  journal= {arXiv preprint arXiv:2309.03426},
  year   = {2024}
}

备注

Published at the Forty-first International Conference on Machine Learning (ICML 2024)