通过乐观策略搜索与规划实现高效的基于模型的强化学习
机器学习
2020-12-02 v3 机器人学
系统与控制
系统与控制
机器学习
摘要
具有概率动力学模型的基于模型的强化学习算法是最具数据效率的学习方法之一。这通常归因于它们区分认知不确定性和偶然不确定性的能力。然而,尽管大多数算法在学习模型时区分了这两种不确定性,但在优化策略时却忽略了它,这导致贪婪且不足的探索。同时,对于乐观探索算法尚无实用的求解器。在本文中,我们提出一种实用的乐观探索算法(H-UCRL)。H-UCRL 重新参数化可信模型集合,并直接对认知不确定性进行幻觉控制。通过用幻觉输入扩充输入空间,H-UCRL 可使用标准贪婪规划器求解。此外,我们分析了 H-UCRL 并为良好校准的模型构造了一个通用后悔界,在高斯过程模型情形下该界可证明为次线性的。基于这一理论基础,我们展示了乐观探索如何能轻松地与最先进的强化学习算法和不同概率模型结合。我们的实验表明,当对动作存在惩罚时,乐观探索显著加速学习,而这一设定对现有基于模型的强化学习算法而言是出了名的困难。
引用
@article{arxiv.2006.08684,
title = {Efficient Model-Based Reinforcement Learning through Optimistic Policy Search and Planning},
author = {Sebastian Curi and Felix Berkenkamp and Andreas Krause},
journal= {arXiv preprint arXiv:2006.08684},
year = {2020}
}