中文

通过乐观引导与反向归纳的原则性探索

机器学习 2021-05-18 v2

摘要

一种可证明高效探索的原则性方法是将上置信界(UCB)作为奖励项纳入价值函数。然而,UCB被指定用于处理线性和表格化设定,与深度强化学习(DRL)不兼容。本文提出一种用于DRL的原则性探索方法,通过乐观引导与反向归纳(OB2I)。OB2I在DRL中通过非参数bootstrap构建通用UCB奖励项。该UCB奖励项估计状态-动作对的认知不确定性以进行乐观探索。我们在线性设定下建立了所提UCB奖励项与LSVI-UCB的理论联系。我们通过回合式反向更新以时间一致的方式传播未来不确定性,这利用了理论优势并在经验上提升了样本效率。我们在MNIST迷宫和Atari套件上的实验表明,OB2I优于多种最先进的探索方法。

关键词

引用

@article{arxiv.2105.06022,
  title  = {Principled Exploration via Optimistic Bootstrapping and Backward Induction},
  author = {Chenjia Bai and Lingxiao Wang and Lei Han and Jianye Hao and Animesh Garg and Peng Liu and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2105.06022},
  year   = {2021}
}

备注

ICML 2021