中文

用于纳什均衡的深度Q学习:Nash-DQN

机器学习 2022-10-25 v2 计算机科学与博弈论 计算金融 机器学习

摘要

多智能体随机博弈的无模型学习是一个活跃的研究领域。然而,现有的强化学习算法通常局限于零和博弈,且仅适用于小状态-动作空间或其他简化设定。在此,我们开发了一种新的数据高效深度Q学习方法,用于一般和随机博弈中纳什均衡的无模型学习。该算法使用随机博弈的局部线性二次展开,从而得到可解析求解的最优动作。该展开由深度神经网络参数化,使其具有足够的灵活性来学习环境,而无需经历所有状态-动作对。我们研究了源自标签不变随机博弈的算法对称性性质,并作为概念验证,将我们的算法应用于竞争电子市场中最优交易策略的学习。

关键词

引用

@article{arxiv.1904.10554,
  title  = {Deep Q-Learning for Nash Equilibria: Nash-DQN},
  author = {Philippe Casgrain and Brian Ning and Sebastian Jaimungal},
  journal= {arXiv preprint arXiv:1904.10554},
  year   = {2022}
}

备注

15 pages, 3 figures