无模型平均场强化学习:平均场 MDP 与平均场 Q-学习
最优化与控制
2021-10-14 v2 机器学习
摘要
我们通过平均场马尔可夫决策过程(MFMDP)的视角研究带公共噪声的无限 horizon 折扣平均场控制(MFC)问题。我们允许智能体使用不仅在个体层面而且在群体层面随机化的动作。这种公共随机化使我们能够建立 MFC 的闭环与开环策略同 MFMDP 的马尔可夫策略之间的联系。特别地,我们证明原 MFC 存在最优闭环策略。基于该框架和状态-动作值函数的概念,我们随后通过将已有的表格与深度 RL 方法适配到平均场设定,提出了针对此类问题的强化学习(RL)方法。主要困难在于对群体状态的处理,它是策略与值函数的输入。我们给出了基于单纯形离散化的表格算法的收敛性保证。基于神经网络的算法更适用于连续空间,并使我们避免对平均场状态空间进行离散化。文中给出了数值示例。
引用
@article{arxiv.1910.12802,
title = {Model-Free Mean-Field Reinforcement Learning: Mean-Field MDP and Mean-Field Q-Learning},
author = {René Carmona and Mathieu Laurière and Zongjun Tan},
journal= {arXiv preprint arXiv:1910.12802},
year = {2021}
}