中文

赌徒问题及其拓展

机器学习 2020-07-14 v3 人工智能 机器学习

摘要

我们分析赌徒问题,这是一个简单的强化学习问题,其中赌徒有机会将赌注翻倍或输掉,直到达到目标。这是 Sutton 和 Barto (2018) 的强化学习教科书中引入的一个早期示例,他们提到了最优值函数具有高频分量和重复非平滑点的有趣模式,但未作进一步研究。我们给出了离散和连续情况下最优值函数的精确公式。尽管看似简单,该值函数是病态的:分形、自相似、导数取零或无穷,且不能写为初等函数。它事实上是广义 Cantor 函数之一,具有迄今未被探明的复杂性。我们的分析可为实际应用中改进值函数近似、基于梯度的算法和 Q-learning 提供见解。

关键词

引用

@article{arxiv.2001.00102,
  title  = {The Gambler's Problem and Beyond},
  author = {Baoxiang Wang and Shuai Li and Jiajin Li and Siu On Chan},
  journal= {arXiv preprint arXiv:2001.00102},
  year   = {2020}
}

备注

International Conference on Learning Representations (ICLR) 2020