中文

公平感知强化学习(FAReL):面向透明且平衡的序列决策框架

机器学习 2025-09-29 v1 人工智能

摘要

现实世界中的序列决策问题可以通过公平感知方法来强制实现公平性。因此,我们需要能够在性能与期望的公平性概念之间做出适当且透明的权衡的算法。由于期望的性能-公平性权衡难以先验指定,我们提出一个框架,可以在其中探索多种权衡。强化学习算法提供的关于可获得的性能-公平性权衡的洞察随后可以指导利益相关者选择最合适的策略。为了捕捉公平性,我们提出了一个扩展的马尔可夫决策过程 ffMDP,显式地编码个体和群体。在给定该 ffMDP 的前提下,我们在序列决策问题的语境中形式化了公平性概念,并构建了一个随时间计算公平性度量的公平性框架。我们在两个具有不同公平性需求的场景中评估了我们的框架:职位招聘,需要组建强团队同时平等对待申请者;以及欺诈检测,需要检测欺诈交易同时确保客户负担公平分配。我们表明该框架在多个场景中学习到了更公平的策略,仅在性能奖励上有轻微损失。此外,我们观察到群体公平性和个体公平性概念并不必然相互蕴含,这凸显了当两种公平性类型均被期望时本框架的优势。最后,我们提供了如何在不同问题设置中应用该框架的指导。

关键词

引用

@article{arxiv.2509.22232,
  title  = {Fairness-Aware Reinforcement Learning (FAReL): A Framework for Transparent and Balanced Sequential Decision-Making},
  author = {Alexandra Cimpean and Nicole Orzan and Catholijn Jonker and Pieter Libin and Ann Nowé},
  journal= {arXiv preprint arXiv:2509.22232},
  year   = {2025}
}