中文

面向深度强化学习的策略性乐观与悲观估计

机器学习 2022-04-07 v5

摘要

近年来,深度离策略 actor-critic 算法已成为连续控制强化学习的主流方法。其性能提升的主要驱动力之一是使用悲观价值更新来解决函数逼近误差,而这此前导致了不尽人意的表现。然而,悲观的一个直接后果是探索减少,与理论上支持面对不确定性时乐观有效性的观点相悖。那么哪种方法最好?本工作中,我们表明最有效的乐观程度可因任务而异,并随学习过程变化。受此启发,我们提出了一种新颖的深度 actor-critic 框架——策略性乐观与悲观(TOP)估计,它在线切换乐观与悲观价值学习。这是通过将选择表述为多臂老虎机问题实现的。我们在一系列连续控制任务中表明,TOP 优于依赖固定乐观程度的现有方法,在具有挑战性的基于像素的环境中确立了新的 SOTA。由于我们的改动易于实现,我们相信这些见解可轻松融入众多离策略算法。

关键词

引用

@article{arxiv.2102.03765,
  title  = {Tactical Optimism and Pessimism for Deep Reinforcement Learning},
  author = {Ted Moskovitz and Jack Parker-Holder and Aldo Pacchiano and Michael Arbel and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2102.03765},
  year   = {2022}
}