中文

零和马尔可夫博弈中的值函数逼近

人工智能 2013-01-07 v1

摘要

本文研究零和马尔可夫博弈背景下的值函数逼近问题,该博弈可视为马尔可夫决策过程(MDP)框架向双智能体情况的推广。我们将MDP的误差界推广至马尔可夫博弈,并描述了强化学习算法向马尔可夫博弈的推广。我们提出了最优停止问题向双人同时行动马尔可夫博弈的推广。针对这一特殊问题,我们给出了更强的误差界,并能保证LSTD和基于线性值函数逼近的时序差分学习的收敛性。我们通过使用最小二乘策略迭代(LSPI)算法为足球领域和流量控制问题学习优良策略,证明了值函数逼近在马尔可夫博弈中的可行性。

关键词

引用

@article{arxiv.1301.0580,
  title  = {Value Function Approximation in Zero-Sum Markov Games},
  author = {Michail Lagoudakis and Ron Parr},
  journal= {arXiv preprint arXiv:1301.0580},
  year   = {2013}
}

备注

Appears in Proceedings of the Eighteenth Conference on Uncertainty in Artificial Intelligence (UAI2002)