弱耦合马尔可夫决策过程中的公平资源分配
机器学习
2025-04-29 v2
摘要
我们考虑在建模为弱耦合马尔可夫决策过程的序贯决策环境中进行公平资源分配,其中资源约束耦合了原本独立运行的 个子马尔可夫决策过程(子 MDP)的动作空间。我们采用广义基尼函数作为公平性定义,而非传统的功利主义(总和)目标。在引入一个基于线性规划的通用但计算代价高昂的求解方案后,我们专注于所有子 MDP 相同的同质情况。对于这种情况,我们首次证明该问题归结为在“排列不变”策略类上优化功利主义目标。这一结果特别有用,因为我们可以在不安宁老虎机设置中利用 Whittle 指数策略,而在更一般的设置中,我们引入了一种基于计数比例的深度强化学习方法。最后,我们通过全面的实验验证了理论发现,确认了所提方法在实现公平性方面的有效性。
引用
@article{arxiv.2411.09804,
title = {Fair Resource Allocation in Weakly Coupled Markov Decision Processes},
author = {Xiaohui Tu and Yossiri Adulyasak and Nima Akbarzadeh and Erick Delage},
journal= {arXiv preprint arXiv:2411.09804},
year = {2025}
}