基于生成模型的近极小极大最优分布强化学习
机器学习
2024-11-05 v2 机器学习
摘要
我们提出了一种新的基于模型的分布强化学习(RL)算法,并证明了它在利用生成模型近似回报分布方面是极小极大最优的(在对数因子范围内),从而解决了 Zhang 等人(2023)提出的一个开放性问题。我们的分析为分布式 RL 的分类方法提供了新的理论结果,并引入了一种新的分布贝尔曼方程,即随机分类累积分布函数(CDF)贝尔曼方程,我们预计其具有独立的研究价值。此外,我们还提供了一项实验研究,比较了多种基于模型的分布 RL 算法,并为从业者总结了几点启示。
引用
@article{arxiv.2402.07598,
title = {Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model},
author = {Mark Rowland and Li Kevin Wenliang and Rémi Munos and Clare Lyle and Yunhao Tang and Will Dabney},
journal= {arXiv preprint arXiv:2402.07598},
year = {2024}
}
备注
NeurIPS 2024