具有大状态空间与约束空间的强化学习中的交叉公平性
机器学习
2025-02-18 v1 计算机科学与博弈论
摘要
在传统强化学习(RL)中,学习者的目标是求解一个单目标优化问题:找到最大化期望奖励的策略。然而,在许多现实场景中,同时优化多个目标十分重要。例如,当我们关注公平时,状态可能具有对应于多个(交叉的)人口学群体的特征标注,奖励会分配给这些群体,而我们的目标可能是最大化获得最少奖励的群体的奖励。在本工作中,我们考虑一个多目标优化问题,其中每个目标由对单一标量奖励函数的基于状态的重新加权来定义。这推广了最大化最小奖励群体奖励的问题。我们提供了预言机高效的算法来求解这些多目标强化学习问题,即使目标数量呈指数级增长——对于表格 MDP,以及当群组函数具有额外结构时的大规模 MDP 均适用。最后,我们通过实验验证了理论结果,并展示了其在优先连接图 MDP 上的应用。
引用
@article{arxiv.2502.11828,
title = {Intersectional Fairness in Reinforcement Learning with Large State and Constraint Spaces},
author = {Eric Eaton and Marcel Hussing and Michael Kearns and Aaron Roth and Sikata Bela Sengupta and Jessica Sorrell},
journal= {arXiv preprint arXiv:2502.11828},
year = {2025}
}