中文

双重策略迭代

机器学习 2019-04-09 v2 机器学习

摘要

近来,一类新颖的近似策略迭代(API)算法展现了令人印象深刻的实际性能(如 [2] 中的 ExIt、[27] 中的 AlphaGo-Zero)。这一新算法族维护并交替优化两个策略:一个在测试时部署的快速反应式策略(如深度神经网络),以及一个可多步前瞻规划的慢速非反应式策略(如树搜索)。反应式策略在非反应式策略的监督下更新,而非反应式策略在反应式策略的引导下进行改进。本工作中,我们在交替优化框架下研究此双重策略迭代(DPI)策略,并给出推广现有 API 理论的收敛性分析。我们还发展了该框架的一个特殊实例,将非反应式策略的更新化简为使用所学局部模型的基于模型的最优控制,并提供了在未知动态下统一无模型与基于模型 RL 方法的理论严谨途径。我们在多个连续控制马尔可夫决策过程上展示了我们方法的有效性。

关键词

引用

@article{arxiv.1805.10755,
  title  = {Dual Policy Iteration},
  author = {Wen Sun and Geoffrey J. Gordon and Byron Boots and J. Andrew Bagnell},
  journal= {arXiv preprint arXiv:1805.10755},
  year   = {2019}
}

备注

NeurIPS 2018; Additional related works