中文

用于离线强化学习的不确定性加权演员-评论家方法

机器学习 2021-05-19 v1

摘要

离线强化学习有望从先前收集的静态数据集中学习有效策略,而无需探索。然而,现有的Q学习与基于演员-评论家的离策略RL算法在从分布外(OOD)动作或状态自举时失败。我们假设现有方法缺失的一个关键要素是对离线设定中不确定性的恰当处理。我们提出不确定性加权演员-评论家(UWAC),一种检测OOD状态-动作对并相应降低其在训练目标中贡献的算法。在实现上,我们采用一种实用且有效的基于dropout的不确定性估计方法,相较现有RL算法引入极少开销。经验上,我们观察到UWAC在训练期间大幅改善模型稳定性。此外,UWAC在多种竞争性任务上优于现有离线RL方法,并在由人类专家收集的稀疏演示数据集上相较最先进基线取得显著性能提升。

关键词

引用

@article{arxiv.2105.08140,
  title  = {Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning},
  author = {Yue Wu and Shuangfei Zhai and Nitish Srivastava and Joshua Susskind and Jian Zhang and Ruslan Salakhutdinov and Hanlin Goh},
  journal= {arXiv preprint arXiv:2105.08140},
  year   = {2021}
}

备注

To appear in ICML 2021