中文

将显式不确定性估计纳入深度离线强化学习

机器学习 2022-06-03 v1

摘要

离线强化学习设定中大多数基于理论的文献都要求精确的不确定性估计。这一要求将此类文献中推导的算法限制在了存在这种估计的表格化和线性设定中。在本文中,我们开发了一种将可扩展不确定性估计纳入名为 deep-SPIBB 的离线强化学习算法的新方法,该方法将 SPIBB 系列算法扩展到具有更大状态和动作空间的环境。我们利用深度学习社区中不确定性估计的最新进展,获得更具可扩展性的不确定性估计以嵌入 deep-SPIBB。尽管这些不确定性估计无法提供与表格情形相同的理论保证,我们认为 SPIBB 纳入不确定性的机制比将不确定性作为值函数惩罚的悲观方法更鲁棒、更灵活。我们通过实证证明了这一点,表明 deep-SPIBB 在拥有相同不确定性估计的情况下优于基于悲观的方法,并在多个环境和数据集上至少与多种其他强基线表现相当。

关键词

引用

@article{arxiv.2206.01085,
  title  = {Incorporating Explicit Uncertainty Estimates into Deep Offline Reinforcement Learning},
  author = {David Brandfonbrener and Remi Tachet des Combes and Romain Laroche},
  journal= {arXiv preprint arXiv:2206.01085},
  year   = {2022}
}