中文

带学习的平均场控制的动态规划原理

最优化与控制 2022-04-18 v6

摘要

动态规划原理(DPP)对于控制与优化至关重要,包括马尔可夫决策问题(MDPs)、强化学习(RL)以及近来的平均场控制(MFCs)。然而,在 MFCs 的学习框架中,尽管其对算法设计极为关键,DPP 尚未被严格建立。在本文中,我们首先给出一个带学习的 MFCs 中 DPP 因错误设定的 Q 函数而不成立的简单例子;随后提出适用于带学习 MFCs 的恰当空间中的正确 Q 函数形式。这一特定形式的 Q 函数不同于经典形式,被称为 IQ 函数。在转移概率与奖励独立于平均场信息的特殊情况下,它将对单智能体 RL 的经典 Q 函数积分于状态-动作分布之上。换言之,带学习的 MFCs 可视为通过以概率分布空间替代状态-动作空间来提升经典 RL。这一 IQ 函数的辨识使我们能够精确建立 MFCs 学习框架中的 DPP。最后,我们通过数值实验说明了该 IQ 函数的时间一致性。

关键词

引用

@article{arxiv.1911.07314,
  title  = {Dynamic Programming Principles for Mean-Field Controls with Learning},
  author = {Haotian Gu and Xin Guo and Xiaoli Wei and Renyuan Xu},
  journal= {arXiv preprint arXiv:1911.07314},
  year   = {2022}
}