马尔可夫决策过程拥塞博弈中用于约束满足的收费机制
计算机科学与博弈论
2021-12-14 v1 最优化与控制
摘要
马尔可夫决策过程(MDP)拥塞博弈是经典拥塞博弈的扩展,其中连续的自利智能体群体求解带拥塞的马尔可夫决策过程:一种策略的收益随着更多群体使用它而降低。我们在带容量拥塞博弈与 MDP 的关键概念之间建立类比。特别地,我们表明 MDP 拥塞博弈中的群体质量约束等价于在奖励函数上施加收费/激励,社会规划者可利用其实现辅助目标。我们在一个模拟的西雅图网约车模型中展示了此类方法,其中为实现两个独立目标而施行收费与激励:保证西雅图市中心最小司机密度,以及将博弈均衡推向最大社会产出。
引用
@article{arxiv.1903.00747,
title = {Tolling for Constraint Satisfaction in Markov Decision Process Congestion Games},
author = {Sarah H. Q. Li and Yue Yu and Daniel Calderone and Lillian Ratliff and Behcet Acikmese},
journal= {arXiv preprint arXiv:1903.00747},
year = {2021}
}
备注
7 pages, 6 figures, accepted to American Control Conference 2019