中文

基于生成模型的近极小极大最优分布强化学习

机器学习 2024-11-05 v2 机器学习

摘要

我们提出了一种新的基于模型的分布强化学习(RL)算法,并证明了它在利用生成模型近似回报分布方面是极小极大最优的(在对数因子范围内),从而解决了 Zhang 等人(2023)提出的一个开放性问题。我们的分析为分布式 RL 的分类方法提供了新的理论结果,并引入了一种新的分布贝尔曼方程,即随机分类累积分布函数(CDF)贝尔曼方程,我们预计其具有独立的研究价值。此外,我们还提供了一项实验研究,比较了多种基于模型的分布 RL 算法,并为从业者总结了几点启示。

关键词

引用

@article{arxiv.2402.07598,
  title  = {Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model},
  author = {Mark Rowland and Li Kevin Wenliang and Rémi Munos and Clare Lyle and Yunhao Tang and Will Dabney},
  journal= {arXiv preprint arXiv:2402.07598},
  year   = {2024}
}

备注

NeurIPS 2024