深度强化学习的后验采样
机器学习
2023-05-19 v2 人工智能
摘要
尽管取得了显著成功,深度强化学习算法仍然样本效率低下:它们需要大量的试错才能找到好的策略。基于模型的算法通过构建可用于规划的环境模型来承诺样本效率。强化学习的后验采样(Posterior Sampling for Reinforcement Learning)正是一种基于模型的算法,因其在表格环境下的表现而引起了极大关注。本文介绍了深度强化学习的后验采样(PSDRL),这是首个真正可扩展的强化学习后验采样近似方法,保留了其基于模型的本质。PSDRL 将潜在状态空间模型上的高效不确定性量化与基于值函数近似、专门定制的持续规划算法相结合。在 Atari 基准上的大量实验表明,PSDRL 显著优于先前扩展后验采样的最先进尝试,同时在样本效率和计算效率上与最先进的(基于模型的)强化学习方法具有竞争力。
引用
@article{arxiv.2305.00477,
title = {Posterior Sampling for Deep Reinforcement Learning},
author = {Remo Sasso and Michelangelo Conserva and Paulo Rauber},
journal= {arXiv preprint arXiv:2305.00477},
year = {2023}
}