中文

学习悲观性以实现鲁棒高效的离策略强化学习

机器学习 2023-03-07 v2 人工智能

摘要

离策略深度强化学习算法通常通过在时序差分学习期间利用对期望目标回报的悲观估计,来补偿过高估计偏差。在本工作中,我们提出广义悲观学习(GPL),一种采用新颖可学习惩罚来实施此种悲观性的策略。具体而言,我们提出在训练评论家的同时以双重 TD 学习来学习该惩罚,这是一种以极小计算代价估计并最小化目标回报偏差大小的新过程。GPL 使我们能够在整个训练过程中准确抵消过高估计偏差,而不会产生过度悲观目标所带来的弊端。通过将 GPL 与流行的离策略算法结合,我们在基于本体感受与基于像素的竞争性基准上均取得了最先进的结果。

关键词

引用

@article{arxiv.2110.03375,
  title  = {Learning Pessimism for Robust and Efficient Off-Policy Reinforcement Learning},
  author = {Edoardo Cetin and Oya Celiktutan},
  journal= {arXiv preprint arXiv:2110.03375},
  year   = {2023}
}

备注

Oral at the 37th AAAI Conference on Artificial Intelligence (AAAI-23)