基于乐观行动者-评论者的更优探索
机器学习
2019-10-29 v1 机器学习
摘要
行动者-评论者方法是一类无模型强化学习,已成功应用于连续控制中的挑战性任务,常取得最先进的性能。然而,这些方法在真实世界领域的广泛采用因其糟糕的样本效率而困难。我们从理论与经验两方面解决该问题。在理论侧,我们辨识出现有最先进算法(如 Soft Actor Critic)中阻碍高效探索的两种现象。第一,将贪婪行动者更新与评论者的悲观估计结合,导致智能体回避其未知的动作,我们称之为悲观欠探索。第二,当前算法方向无信息,从当前均值出发以等概率在相反方向采样动作。这很浪费,因为通常某些方向的动作需求远多于其他方向。为同时应对这两种现象,我们引入新算法 Optimistic Actor Critic,其近似状态-动作值函数的下置信界与上置信界。这使我们能应用面对不确定性时的乐观原则,利用上界进行定向探索,同时仍用下界避免高估。我们在若干连续控制任务中评估 OAC,取得了最先进的样本效率。
引用
@article{arxiv.1910.12807,
title = {Better Exploration with Optimistic Actor-Critic},
author = {Kamil Ciosek and Quan Vuong and Robert Loftin and Katja Hofmann},
journal= {arXiv preprint arXiv:1910.12807},
year = {2019}
}
备注
20 pages (including supplement)