中文

统一值迭代、优势学习与动态策略规划

机器学习 2017-10-31 v1 机器学习

摘要

近似动态规划算法,如近似值迭代,已成功应用于许多复杂强化学习任务,而更好的近似动态规划算法有望进一步拓展强化学习对各任务的适用性。本文提出一种统一值迭代、优势学习与动态策略规划的新型鲁棒动态规划算法。我们称之为广义值迭代(GVI)及其近似版本近似GVI(AGVI)。我们给出了AGVI的性能保证,其作为特例包含了现有算法的性能保证。我们讨论现有算法的理论弱点,并阐释AGVI的优势。在简单环境中的数值实验支持了理论论证,并表明AGVI是此前算法的一个有前景的替代方案。

关键词

引用

@article{arxiv.1710.10866,
  title  = {Unifying Value Iteration, Advantage Learning, and Dynamic Policy Programming},
  author = {Tadashi Kozuno and Eiji Uchibe and Kenji Doya},
  journal= {arXiv preprint arXiv:1710.10866},
  year   = {2017}
}