分布式的更多益处:强化学习的二阶界
机器学习
2024-02-13 v1
摘要
在本文中,我们证明了学习回报分布的分布强化学习(DistRL)可以在具有函数逼近的一般设置下,在在线和离线强化学习中获得二阶界。二阶界是依赖于实例的界,其与回报的方差成比例,我们证明这些界比先前已知的分布强化学习的小损失界更紧。据我们所知,我们的结果是低秩 MDP 和离线强化学习的首个二阶界。当专门应用于上下文赌博机(单步强化学习问题)时,我们表明一种基于分布学习的乐观算法同时实现了二阶最坏情况遗憾界和二阶间隙依赖界。我们还在真实世界数据集上通过实验证明了 DistRL 在上下文赌博机中的益处。我们强调,我们对 DistRL 的分析相对简单,遵循面对不确定性时的乐观主义通用框架,并且不需要加权回归。我们的结果表明,DistRL 是在一般强化学习设置中获得二阶界的一个有前景的框架,从而进一步强化了 DistRL 的优势。
引用
@article{arxiv.2402.07198,
title = {More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning},
author = {Kaiwen Wang and Owen Oertell and Alekh Agarwal and Nathan Kallus and Wen Sun},
journal= {arXiv preprint arXiv:2402.07198},
year = {2024}
}