中文

为何如此悲观?通过集成估计离线强化学习的不确定性,及其独立性的重要性

机器学习 2022-05-30 v1

摘要

受集成方法在监督学习中用于不确定性估计的成功所启发,我们重新审视如何将 QQ-函数集成用作离线强化学习(RL)悲观主义的主要来源。我们首先指出了许多基于集成的 RL 算法所采用的一种流行算法选择中的关键缺陷,即在计算每个集成成员的贝尔曼误差时使用共享的悲观目标值。通过理论分析以及在玩具 MDP 中构造示例,我们证明共享悲观目标会矛盾地导致实质上乐观的价值估计。基于该结果,我们提出 MSG,一种实用的离线 RL 算法,它使用基于完全独立网络独立计算的目标来训练 QQ-函数集成,并依据预测动作值的下置信界优化策略。我们在流行的 D4RL 和 RL Unplugged 离线 RL 基准上的实验表明,在如 antmazes 等具有挑战性的领域,带有深度集成的 MSG 大幅超越了高度调优的最先进方法。此外,通过在基准领域上的消融实验,我们验证了使用独立训练的 QQ-函数至关重要,并研究了集成规模的作用。最后,由于每个集成成员使用独立网络在更大神经网络架构下计算成本会变高,我们探究了为监督学习开发的高效集成近似是否同样有效,并证明它们无法匹配带有独立网络的 MSG 的性能与鲁棒性,凸显了针对 RL 的不确定性估计新方法的必要。

关键词

引用

@article{arxiv.2205.13703,
  title  = {Why So Pessimistic? Estimating Uncertainties for Offline RL through Ensembles, and Why Their Independence Matters},
  author = {Seyed Kamyar Seyed Ghasemipour and Shixiang Shane Gu and Ofir Nachum},
  journal= {arXiv preprint arXiv:2205.13703},
  year   = {2022}
}

备注

Our codebase can be found at https://github.com/google-research/google-research/tree/master/jrl