中文

基于改进渐进对冲算法的贝叶斯强化学习双层求解方案

系统与控制 2019-06-24 v1 机器学习 系统与控制

摘要

兼具固有随机系统噪声与系统参数知识缺失的随机控制构成了强化学习(RL)的核心与基础课题,尤其在非回合制、对在线学习要求更高的情形下。该挑战近期在贝叶斯 RL 中受到显著关注,其中已发展出若干近似技术以寻找次优策略。现有方法主要聚焦于值函数近似或引入 Thompson 采样,本文针对一类贝叶斯 RL 问题,提出一种新颖的双层求解方案,通过下层基于时间分解的动态规划(DP)与上层基于场景分解的改进渐进对冲算法(PHA)直接近似最优策略。我们方法的关键特征是在两个不同层中将可约系统不确定性与不可约系统性分离,从而分而治之。我们尤其通过带有未知增益的线性二次高斯问题来展示我们的求解框架,该问题虽看似简单,却是半个多世纪以来对偶控制中臭名昭著的难题。

关键词

引用

@article{arxiv.1906.09035,
  title  = {Revised Progressive-Hedging-Algorithm Based Two-layer Solution Scheme for Bayesian Reinforcement Learning},
  author = {Xin Huang and Duan Li and Daniel Zhuoyu Long},
  journal= {arXiv preprint arXiv:1906.09035},
  year   = {2019}
}

备注

9 pages, 1 table, submitted to NeurIPS 2019, under review