中文

即便以悲观初始化仍保持乐观探索

机器学习 2020-02-28 v1 人工智能 机器学习

摘要

乐观初始化是强化学习(RL)中高效探索的一种有效策略。在表格情形下,所有可证明高效的免模型算法都依赖于它。然而,受这些可证明高效的表格算法启发的免模型深度 RL 算法并未使用乐观初始化。特别是在仅有正奖励的场景中,由于常用的网络初始化方案,Q 值被初始化为其最低可能值,即一种悲观初始化。仅将网络初始化为输出乐观 Q 值是不够的,因为我们无法确保它们对新颖状态-动作对保持乐观,而这对探索至关重要。我们提出了一种基于计数的简单增广方法,用于悲观初始化的 Q 值,将乐观性的来源与神经网络分离。我们表明该方案在表格设定下可证明高效,并将其推广到深度 RL 设定。我们的算法,乐观悲观初始化 Q 学习(OPIQ),用基于计数的奖励对基于 DQN 的智能体的 Q 值估计进行增广,以在动作选择和自举过程中确保乐观。我们表明 OPIQ 在困难探索任务中优于使用基于伪计数的内在动机的非乐观 DQN 变体,并且它对新颖状态-动作对预测出乐观估计。

关键词

引用

@article{arxiv.2002.12174,
  title  = {Optimistic Exploration even with a Pessimistic Initialisation},
  author = {Tabish Rashid and Bei Peng and Wendelin Böhmer and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2002.12174},
  year   = {2020}
}

备注

Published as a conference paper at ICLR 2020