中文

正则化平均场博弈中的 Q-Learning

最优化与控制 2022-11-11 v3 机器学习 系统与控制 系统与控制

摘要

本文引入一种正则化平均场博弈,并研究该博弈在无限 horizon 折扣奖励函数下的学习问题。正则化是通过在经典平均场博弈模型的一阶段奖励函数中加入一个强凹正则化函数来实现的。我们建立了一种基于值迭代的学习算法,通过拟合 Q-learning 求解该正则化平均场博弈。正则化项通常使强化学习算法对系统组件更具鲁棒性。此外,它使我们能够建立学习算法的误差分析,而无需对系统组件施加限制性的凸性假设,而在没有正则化项时这些假设是必需的。

关键词

引用

@article{arxiv.2003.12151,
  title  = {Q-Learning in Regularized Mean-field Games},
  author = {Berkay Anahtarci and Can Deha Kariksiz and Naci Saldi},
  journal= {arXiv preprint arXiv:2003.12151},
  year   = {2022}
}

备注

32 pages. arXiv admin note: text overlap with arXiv:1912.13309