中文

折扣强化学习并非一个优化问题

人工智能 2019-11-28 v3

摘要

折扣强化学习在持续任务中与函数近似用于控制在根本上不相容。在其通常表述下它并非一个优化问题,因此在使用函数近似时不存在最优策略。我们证实这些主张,进而澄清关于折扣及其与平均奖励表述之间关联的一些误解。我们鼓励研究者在持续任务的强化学习中采用严格的优化方法,如最大化平均奖励。

关键词

引用

@article{arxiv.1910.02140,
  title  = {Discounted Reinforcement Learning Is Not an Optimization Problem},
  author = {Abhishek Naik and Roshan Shariff and Niko Yasui and Hengshuai Yao and Richard S. Sutton},
  journal= {arXiv preprint arXiv:1910.02140},
  year   = {2019}
}

备注

Accepted for presentation at the Optimization Foundations of Reinforcement Learning Workshop at NeurIPS 2019